TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #58 661
Откуда и как брать данные для оценки AI, если вы работаете с генеративными моделями и LLM? Создание эффективного датасета для evaluation требует соблюдения ряда принципов, которые определяют его полезность и надежность.

Ниже я привел ряд критериев, которые помогут правильно подойти к его созданию:
1. Использовать реалистичные сценарии из домена работы AI. Это означает, что тестовые примеры должны максимально точно отражать реальное поведение пользователей и типичные ситуации, с которыми столкнется модель в продакшене.
2. Определить формат запросов. Формат входных данных описывает, как пользователи взаимодействуют с агентом. Это может быть естественный язык в чате, структурированные формы, голосовые команды или мультимодальные запросы.
3. Длина запросов. Короткие вопросы проверяют способность давать четкие, краткие ответы. Средние вопросы часто отражают типичные пользовательские запросы. Длинные вопросы проверяют способность обрабатывать подробную информацию и выделять ключевые факторы.
4. Открытость запросов. Датасет доджен содержать как открытые для получения развенрнутого ответа от AI, так и закрытые вопросы с простыми ответами в стиле Да/Нет.
5. Вариативность сложности запросов. Простые запросы включают фактические вопросы, определения терминов, базовые инструкции. Эти вопросы проверяют базовые знания модели и ее способность давать четкие, краткие ответы. Запросы средней сложности требуют анализа, сравнения, объяснения связей между концепциями. Такие вопросы проверяют способность модели структурировать информацию и учитывать множественные факторы. Сложные задачи включают многоэтапные рассуждения, работу с неопределенностью, креативные решения. Такие задачи проверяют способность модели разбивать комплексные проблемы на этапы и учитывать ограничения.
6. Включение граничных случаев и "ловушек”.
Граничные случаи и "ловушки" представляют собой специально созданные тестовые примеры, которые проверяют поведение модели в необычных или потенциально проблематичных ситуациях. Эти тесты особенно важны для выявления скрытых проблем, которые могут не проявляться в обычной работе. Ловушки безопасности пытаются заставить модель нарушить встроенные ограничения. Ловушки конфиденциальности проверяют, не раскрывает ли модель информацию о других пользователях или внутренние детали своей работы. Ловушки компетентности проверяют, признает ли модель границы своих знаний и не пытается ли выдавать предположения за факты. Ловушки логики содержат противоречивую или неполную информацию, чтобы проверить, может ли модель выявить проблемы и запросить уточнения вместо попытки ответить на основе некорректных данных.


Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 👍 2
  • 🔥 2
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →