Хочу немного поворчать на тему AI evals
Вижу какое-то огромное количество статей и курсов про AI evals за бешеные деньги - но я в упор не понимаю, чему там учить!
1) Что для мануальных, что для автоматизированных evals один и тот же алгоритм:
• анализируем (==смотрим глазами) и категоризируем, где система ошибается
• на основе этого доуточняем наши метрики и определение успеха (и позитивные примеры, если требуется)
• описываем наши наблюдения в формате инструкций: вот первый критерий для оценки, вот как мы его меряем, вот примеры и контрпримеры; вот второй критерий для оценки - и тд
• дальше отдаем это либо в мануальную разметку, либо создаем промпт для LLM as a judge.
2) Есть часть ошибок, которые решаются разработкой, например, простыми эвристиками или classifiers, а также дополнительными алертами и мониторингами. Но вряд ли такому учат на курсе про evals?
В общем, объясните мне, я что-то упускаю? Или это очередная хайпокачка, где продают океанский воздух в банках? 🙂
Post #1589
10.6K
- 💯 70
- ❤ 20
- 😁 4
- 👍 1