При оценке AI систем в я часто сталкивался с проблемой, что существующие фреймворки оценки ИИ систем, такие как deepeval, opik Comet, promptfoo недостаточно гибки с точки зрения оценки. Зачастую используемая внутри система промптов для lim as a judge не способна адаптировать оценку с точки зрения ее стогости и поэтому происходило так, что в либо оценка была завышенна либо занижена. Кроме того, часто возникал вопрос,а почему оценка получилась именно такой, но в во многих фреймворках это черный ящик, если метрики не рассчитываются математически или на базе ембеддингов.
Все это сподвигло меня на пересмотр подхода lim as a judge и разработки собственного алгоритма оценки, который я назвал Temperature-Controlled Verdict Aggregation via Generalized Power Mean
Чтобы было мною изменено:
- Вместо бинарной или тенарной оценки метрики я использовал 5 балльную шкалу Лакерта
- Финальный скор может адаптироваться под требования оценщика за счет изменения параметра температуры в формуле расчета общего степенного среднего.
- Если температура ближе к 1, то оценка будет больше отдавать внимание вердиктам, которые полностью удовлетворяют критериям оценки, если ближе к 0, то вердикты, не соответствующие критериям оценки больше влияют на расчет финального скора и оценка будет ниже.
Таким образом, оценку можно регулировать для каждого проекта и настраивать ее под экспертную оценку, что несомненно большой плюс в работе ИИ инженера
Ну и последнее - весь процесс оценки полностью прозрачен. В verbose logs вы вы видите все вердикты, их оценку, причину это оценки, а также как был рассчитан математически финальный скор через Generalized Power Mean.
Фреймворк доступен в открытом доступе через python pip install eval-ai-library или в открытом репозитории FLS на гит хаб https://github.com/firstlinesoftware/eval-ai-library.
Я активно занимаюсь поддержкой и развитием библиотеки, поэтому буду благодарен любому фидбеку с вашей стороны.
Post #84
616

- 👍 4
- 🔥 3
- ❤ 1