TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #67 838
Сегодня разберем новое интересное исследование Human vs AI-generated tests https://arxiv.org/abs/2510.24739 про то, насколько тесты, созданные ИИ, действительно сопоставимы с теми, что пишут люди.

Когда мы говорим про ИИ генерацию тестового датасета, то обычно подразумеваем, что это позволяет экономить время человека на создание датасета для оценки. Но мы часто не задумаваемся о том, насколько сохраняется качество при такой генерации. В исследоваении авторы провели анализ и как раз постарались ответить на этот вопрос.

Исследование показало, что ИИ хорошо умеет формулировать логичные и грамматически корректные вопросы,
но часто теряется глубина,
то есть ИИ делает запросы в датасете слишком похожими, без разнообразия. В итоге тест вроде выглядит нормально, но проверяет одно и то же под разными формулировками.

Это важно, потому что все чаще можно столкнуться с тем, что многие специалисты используют LLM для генерации тестов, но без должной валидации. Использование такого датасета по факту может привести к тому, что ключевые аспекты ИИ решения будут проверены, а какие-то исключительные ситуации или крайние сценарии не попадут в скоуп проверок.

По сути, статья поднимает проблему, что даже если ИИ сгенерировал 100 запросов для тестового датасета, они должны пройти анализ со стороны человека, иначе это просто красиво оформленные тексты без должного понимания, какие именно аспекты ИИ решения они проверяют.


Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 🔥 5
  • 👍 2
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →