Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценки. Писать большой датасет вручную часто достаточно медленно и скучно, поэтому можно рассмотреть возможность использования синтетического датасета, но при условии, если построен правильно.
На чем стоит фокусироваться?
Начинайте с seed-примеров из реального использования. Возьмите 10–15 диалогов из продакшена или из ручного тестирования. Не придумывайте с нуля, потому что LLM будет генерировать вариации вокруг реальных кейсов, а не выдумывать их из воздуха.
Разворачивайте вариации по трем осям. Одного и того же пользователя с одним запросом недостаточно. Варьируйте: формулировку (как человек спрашивает), намерение (что он на самом деле хочет), поведение (терпеливый, агрессивный, меняет тему на полуслове). Из одного seed-кейса так получают 20–30 дополнительных тестов.
Включайте сложные кейсы намеренно. Датасет только из happy path запросов не покрывает ничего интересного. Генерируйте сценарии где пользователь противоречит себе, запрашивает невозможное, пишет с опечатками и обрывками. Именно на этом агенты ломаются чаще всего.
Проверяйте качество датасета перед использованием. Синтетика часто дает слишком правильные диалоги, который содержат идеальные фразы, чёекие запросы. Прогоните 10% через быструю проверку: если все выглядит как учебник, датасет нереалистичен и стоит вернуться к первым 3-м пунктам выше.
Версионируйте датасет как код. Изменился агент или промпт, значит вам нужна новая версия датасета, иначе непонятно, стало лучше или хуже на каком наборе.
Датасет - это фактически 90% качественного тестирования ИИ системы, поэтому всегда нужно тщательно и правильно подходить к его подготовке.
⚡️⚡️Старт нового потока на курсе по тестированию ИИ - 9 сентября! 🔥
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #178
440

- 🔥 4
- 👍 1
- 💯 1