TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #121 731
Прочитал свежую научную работу и она очень точно описывает то, с чем сталкиваешься при оценке AI агентов на практике.

Авторы задают очень простой, но неудобный вопрос: почему AI агенты показывают высокие результаты на бенчмарках, но продолжают падать в реальных условиях?

И ключевой ответ исследователей заключается в том, что мы измеряем не то, что действиетльно нужно.

Текущий стандарт оценки агентов чаще всего - это процент успешно выполненных задач (Completness Rate). Один показатель, который скрывает критически важные поведенческие свойства ИИ системы. И чтобы расширить анализ показателей качества работы ИИ агента авторы предлагают 12 метрик по четырём измерениям:
Consistency - стабильность результата при повторных запусках
Robustness - устойчивость к вариациям входных данных и сбоям
Predictability - соответствие уверенности агента его реальной точности
Safety - насколько серьёзны ошибки, когда они происходят

После оценки 14 моделей авторы пришли к неутешительному выводу, что рост возможностей за полтора года дал лишь минимальный прирост в надежности. Модели становятся умнее, но к сожалению не надежнее.

На мой взгляд, именно этих измерений сейчас остро не хватает в большинстве существующих фреймворков оценки AI систем и наверное мне стоит на это состредоточиться в моей библиотеке https://library.eval-ai.com/.

Ссылка на исследование
https://arxiv.org/pdf/2602.16666


Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
  • 🔥 6
  • 👍 5
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →