С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. Попробую поделиться своим взглядом по этапам, потому что процесс оценки ИИ должен развиваться вместе с агентом, а не появляться внезапно перед релизом.
Этап 1. Первый прототип. Возможно еще пока еще четко понятных метрик, но уже с первого этапа нужно иметь трейсинг. Тут можно подключите Langfuse или любой другой аналог. Также начните сохранять в файл сценарии, которые вы проверяете вручную, это будет первый данные для драфта датасета.
Этап 2. Golden dataset. Когда поведение ИИ агента становится более-менее стабильным, из собранных сценариев формируется первый датасет. Это примерно 30-50 примеров, включающих edge cases и негативные сценарии, желательно с примерным ожидаемым результатом для каждого.
Этап 3. Измерение метрик. Когда датасет увеличится до сотни кейсов, и ручной прогон станет долгим, начинайте автоматизировать. Начните с детерминированных метрик, например, проверка, вызван ли нужный тул, правильный ли формат, укладывается ли в лимит агент. Потом уже можно подключить использование LLM as a Judge.
Этап 4. CI/CD. Далее можно внедрить оценку в пайплайн, чтобы она запускалась каждый раз при изменениях промпта, модели или тулов.
Этап 5. Мониторинг в продакшене. После релиза часть трафика анализируется на тех же метриках, что и в предпродакшен стадии, чтобы заметить деградацию качества из-за обновлений модели или новых сценариев пользователей. А проблемные кейсы возвращаются в golden dataset, и процесс начинается заново.
На каком этапе сейчас ваши проекты? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #182
222

- 🔥 3
- 👍 2
- ❤ 1
- 💯 1