TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #84 616
При оценке AI систем в я часто сталкивался с проблемой, что существующие фреймворки оценки ИИ систем, такие как deepeval, opik Comet, promptfoo недостаточно гибки с точки зрения оценки. Зачастую используемая внутри система промптов для lim as a judge не способна адаптировать оценку с точки зрения ее стогости и поэтому происходило так, что в либо оценка была завышенна либо занижена. Кроме того, часто возникал вопрос,а почему оценка получилась именно такой, но в во многих фреймворках это черный ящик, если метрики не рассчитываются математически или на базе ембеддингов.

Все это сподвигло меня на пересмотр подхода lim as a judge и разработки собственного алгоритма оценки, который я назвал Temperature-Controlled Verdict Aggregation via Generalized Power Mean

Чтобы было мною изменено:
- Вместо бинарной или тенарной оценки метрики я использовал 5 балльную шкалу Лакерта
- Финальный скор может адаптироваться под требования оценщика за счет изменения параметра температуры в формуле расчета общего степенного среднего.
- Если температура ближе к 1, то оценка будет больше отдавать внимание вердиктам, которые полностью удовлетворяют критериям оценки, если ближе к 0, то вердикты, не соответствующие критериям оценки больше влияют на расчет финального скора и оценка будет ниже.

Таким образом, оценку можно регулировать для каждого проекта и настраивать ее под экспертную оценку, что несомненно большой плюс в работе ИИ инженера

Ну и последнее - весь процесс оценки полностью прозрачен. В verbose logs вы вы видите все вердикты, их оценку, причину это оценки, а также как был рассчитан математически финальный скор через Generalized Power Mean.

Фреймворк доступен в открытом доступе через python pip install eval-ai-library или в открытом репозитории FLS на гит хаб https://github.com/firstlinesoftware/eval-ai-library.

Я активно занимаюсь поддержкой и развитием библиотеки, поэтому буду благодарен любому фидбеку с вашей стороны.
  • 👍 4
  • 🔥 3
  • ❤ 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →