TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #130 621
Почему мой фреймворк eval-ai-library лучше чем DeepEval или RAGAS?

Последний год я исследовал, как существующие фреймворки (RAGAS, DeepEval) оценивают качество AI-систем, и почему их результаты часто расходятся с человеческой оценкой. Результатом данного исследования стал мой opensource фрейморв eval=ai-lib, внутри которого присутствует мой собственный метод TCVA (Temperature-Controlled Verdict Aggregation).

Что видно на графиках:
График 1 — сравнение корреляции с человеческими оценками на трех бенчмарках:
• На faithfulness TCVA и RAGAS идут практически вровень (0.667 vs 0.676)
• На relevancy TCVA обходит RAGAS: 0.480 vs 0.411 (+17%)
• DeepEval стабильно отстает на всех датасетах

График 2 — bootstrap-анализ с доверительными интервалами:
• На faithfulness разница между TCVA и RAGAS статистически незначима (p = 0.759), что говорит о том, что методы реально сопоставимы
• На relevancy TCVA значимо лучше (p = 0.041), и это не случайность, а системное преимущество

Почему так происходит?
Ключевая проблема RAGAS - это бинарные вердикты. Каждое утверждение либо да, либо нет, но реальность не бинарна. Когда AI-система дает ответ, который на 80% корректен, бинарная оценка теряет нюансы.

TCVA использует 5-уровневую шкалу вердиктов и агрегирует их через обобщённое степенное среднее с параметром температуры:
• Низкая температура → строгая оценка (для медицины, финансов)
• Высокая температура → мягкая оценка (для чат-ботов, креативных задач)

И самое важное, что переключение между режимами не требует дополнительных вызовов LLM.
Один раз получили вердикты, дальше агрегируем как нужно.

Когда мы оцениваем AI-систему, уровень строгости должен зависеть от домена применения. Один и тот же ответ может быть отличным для чат-бота и недопустимым для медицинского ассистента. Универсальный бинарный подход этого не учитывает.

Исходный код метода доступен в open source https://github.com/meshkovQA/Eval-ai-library


Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 🔥 9
  • ❤ 2
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →