Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оценивать ИИ системы, а именно отсутствие эталонного ответа. ИИ ассистент отвечает на открытый вопрос, генерирует объяснение или саммари, и один и тот же запрос можно закрыть разными вариантами ответов. В данной ситуации получается, что сравнивать с reference просто не с чем, но оценивать это все таки нужно.
В таком случае фокус смещается с вопроса совпал ли ответ с эталоном на вопрос соответствует ли ответ запросу, контексту и требованиям к системе. И под это есть свой набор reference-free метрик:
Answer Relevancy - отвечает ли ответ на то, что спросили, а не на соседний вопрос.
Faithfulness / Groundedness - опирается ли ответ на переданный контекст, или модель что-то добавила от себя. Это главная метрика, особенно для RAG.
Completeness - закрыты ли все части запроса, если пользователь спросил три вещи, а ответ про одну
Role adherence и tone - остается ли система в рамках своей роли, формата и стиля.
Consistency - дает ли система похожий ответ на перефразированный запрос, это уже метаморфическое тестирование.
Для агентов сюда добавляется еще и оценка трейсов, то есть правильный ли инструмент выбран и с теми ли аргументами.
Теперь про подводные камни.
Первое, все эти метрики считаются через LLM as a Judge, а судья шумит и имеет свои bias, поэтому одного прогона недостаточно и часть результатов все равно нужно смотреть руками.
Второе, judge не умеет проверять факты без контекста, он оценивает правдоподобность, а не истинность, поэтому faithfulness без хорошего контекста ничего не защищает.
Третье, базовые метрики из коробки часто дают высокие оценки, и без кастомных критериев под ваш домен вы получите красивые 90% везде и ноль понимания, где система реально ломается.
Поэтому, отсутствие groundtruth не означает, что нельзя оценить ИИ систему, просто оценка становится многомерной, а ее качество упирается в то, насколько хорошо вы описали критерии.
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #179
404

- 👍 6
- ❤ 2
- 💯 2
- 🔥 1