Хочу поговорить про то, что я наблюдаю довольно часто, когда команды начинают заниматься оценкой своих AI систем.
Первый вопрос, который мне обычно задают - это какой инструмент использовать (или еще на курсе спрашивают, а будет ли мы изучать то-то). В итоге идет выбор инструмента, DeepEval, Promptfoo, Ragas, Opik Comet, дальше начинается обсуждение фич, интеграций, лицензий, получают какие-то цифры, и на этом часто все заканчивается, потому что что с этими цифрами делать дальше непонятно.
И вот в чём проблема.
Инструмент ИИ оценки - это просто механизм запуска метрик.
Он не скажет вам на каких данных нужно тестировать вашу систему, потому что синтетические запросы и реальный продакшн запросы дают принципиально разные результаты.
Он не скажет вам какие аспекты важны именно для вашего домена.
Он не скажет вам какие метрики можно использовать и нужно ли их калибровать.
Он не скажет вам как интерпретировать результаты, особенно когда одна метрика растет, а другая падает.
Все это по факту методологические решения, которые остаются за человеком независимо от того, какой инструмент вы выбрали.
Я видел команды, которые месяцами использовали DeepEval, получали красивые дашборды с метриками, и при этом не могли ответить на простой вопрос, стала ли их AI система лучше после последнего обновления промпта? Потому что метрики были, но они измеряли только какие-то базовые аспеки ИИ системы, при этом упуская важные нюансы, которые докручиваются уже с помощью методологии.
Сталкивались с такой ситуацией?
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #151
556

- 🔥 4
- ❤ 2