Всем привет!
В выходные, после просмотра пары видео на тему развития AI подумал, что сегодня существует большое количество бенчмарков на разные возможности модели, включая кодинг, но почему то нет бенчмарка на оценку моделей и агентов в части генерации тест-кейсов (не unit).
Поэтому, я решил попробовать подумать над этой задачей и решить ее.
Это не просто проект. Потенциально - это будет полноценный научный проект по созданию бенчмарка для оценки ИИ агентов в части генерации тестов, который я планирую опубликовать на hugging face, а также подготовить и опубликовать научную работу по нему.
К чем я все это?
1. Я ищу людей, которым было бы интересно безвозмездно принять в таком проекте в свободное время.
Основным требования:
• опыт в тестировании и написании тестов от 2-3 лет
• знание и умение принять на практике техники тест дизайна базовые
• английский на уровне upper-intermediate (весь датасет будет на англ + возможно участники из других стран)
Если вы готовы принять участие в данном исследовании, как полноценный участник, пишите мне в личку @al_meshkov
2. Я ищу тех, кто готов поделить данными для бенчмарка, интересует связка “требования - написанные под них тесты”. Конечно понимая NDA, можно предоставить их обезличенными, а также с письменным согласием от компании.
Если у вас есть какие-то пет проекты, ваши обучающие проекты, где вы или кто-то писал тесты, или вы или ваша компания готова поделиться данными, пишите мне в личку @al_meshkov
В общем в начале года я говорил о том, что хотел бы создать комьюнити, которое бы развивало и двигало тему ИИ тестирования вперед, и это будет первых проект, который я хочу попробовать реализовать в рамках данного комьюнити.
Если у вас также есть какие то идеи в части развития практик как тестирования ИИ, так и тестирования с помощью ИИ (ai-assisted testing), велком, пишите!
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #127
712

- 🔥 15
- ❤ 3