Откуда и как брать данные для оценки AI, если вы работаете с генеративными моделями и LLM? Создание эффективного датасета для evaluation требует соблюдения ряда принципов, которые определяют его полезность и надежность.
Ниже я привел ряд критериев, которые помогут правильно подойти к его созданию:
1. Использовать реалистичные сценарии из домена работы AI. Это означает, что тестовые примеры должны максимально точно отражать реальное поведение пользователей и типичные ситуации, с которыми столкнется модель в продакшене.
2. Определить формат запросов. Формат входных данных описывает, как пользователи взаимодействуют с агентом. Это может быть естественный язык в чате, структурированные формы, голосовые команды или мультимодальные запросы.
3. Длина запросов. Короткие вопросы проверяют способность давать четкие, краткие ответы. Средние вопросы часто отражают типичные пользовательские запросы. Длинные вопросы проверяют способность обрабатывать подробную информацию и выделять ключевые факторы.
4. Открытость запросов. Датасет доджен содержать как открытые для получения развенрнутого ответа от AI, так и закрытые вопросы с простыми ответами в стиле Да/Нет.
5. Вариативность сложности запросов. Простые запросы включают фактические вопросы, определения терминов, базовые инструкции. Эти вопросы проверяют базовые знания модели и ее способность давать четкие, краткие ответы. Запросы средней сложности требуют анализа, сравнения, объяснения связей между концепциями. Такие вопросы проверяют способность модели структурировать информацию и учитывать множественные факторы. Сложные задачи включают многоэтапные рассуждения, работу с неопределенностью, креативные решения. Такие задачи проверяют способность модели разбивать комплексные проблемы на этапы и учитывать ограничения.
6. Включение граничных случаев и "ловушек”.
Граничные случаи и "ловушки" представляют собой специально созданные тестовые примеры, которые проверяют поведение модели в необычных или потенциально проблематичных ситуациях. Эти тесты особенно важны для выявления скрытых проблем, которые могут не проявляться в обычной работе. Ловушки безопасности пытаются заставить модель нарушить встроенные ограничения. Ловушки конфиденциальности проверяют, не раскрывает ли модель информацию о других пользователях или внутренние детали своей работы. Ловушки компетентности проверяют, признает ли модель границы своих знаний и не пытается ли выдавать предположения за факты. Ловушки логики содержат противоречивую или неполную информацию, чтобы проверить, может ли модель выявить проблемы и запросить уточнения вместо попытки ответить на основе некорректных данных.
Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #58
661

- 👍 2
- 🔥 2