Команда запускает оценку, получает accuracy 95% и считает что система работает хорошо. Но когда начинаешь разбираться глубже, оказывается что за этой цифрой может скрываться совершенно разная картина в зависимости от того, как именно она была получена.
Я выделил основные вопросы, которые должны возникать у AI eval инженера, при интерпертации метрик:
1. На каких данных считалась эта метрика. Реальные пользователи задают вопросы иначе, используют другую лексику, уходят от ожидаемого сценария. Система с 95% на синтетическом датасете вполне может показывать 70% на реальном трафике.
2. Что именно считается правильным ответом. Для разных доменов это принципиально разная планка. Медицинский ассистент с 95% accuracy - это значит что в 5% случаев он даёт потенциально опасную информацию. Для чат-бота поддержки те же 5% ошибок абсолютно некритичны. Одна и та же цифра, принципиально разные выводы.
3. Как распределены эти 5% ошибок. Система может ошибаться равномерно по всем типам запросов, а может стабильно работать на 99% кейсов и полностью ломаться на конкретной категории. Агрегированная метрика это скрывает, и именно в этой скрытой категории может лежать самый критичный бизнес-сценарий.
4. По сравнению с чем это 95%. Без baseline непонятно это хорошо или плохо. Предыдущая версия системы давала 97%? Тогда это деградация. Давала 80%? Тогда это прогресс. Цифра без динамики не говорит ничего.
Поэтому когда мне показывают результаты оценки AI системы в виде одной красивой цифры, первое что я делаю, начинаю задавать именно эти вопросы, потому что метрика без контекста - это не знание о качестве системы, это иллюзия этого знания.
А вы сталкивались с ситуацией когда красивые цифры в оценке расходились с реальным поведением системы? 👇
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #156
550

- 👍 4