Прочитал свежую научную работу и она очень точно описывает то, с чем сталкиваешься при оценке AI агентов на практике.
Авторы задают очень простой, но неудобный вопрос: почему AI агенты показывают высокие результаты на бенчмарках, но продолжают падать в реальных условиях?
И ключевой ответ исследователей заключается в том, что мы измеряем не то, что действиетльно нужно.
Текущий стандарт оценки агентов чаще всего - это процент успешно выполненных задач (Completness Rate). Один показатель, который скрывает критически важные поведенческие свойства ИИ системы. И чтобы расширить анализ показателей качества работы ИИ агента авторы предлагают 12 метрик по четырём измерениям:
Consistency - стабильность результата при повторных запусках
Robustness - устойчивость к вариациям входных данных и сбоям
Predictability - соответствие уверенности агента его реальной точности
Safety - насколько серьёзны ошибки, когда они происходят
После оценки 14 моделей авторы пришли к неутешительному выводу, что рост возможностей за полтора года дал лишь минимальный прирост в надежности. Модели становятся умнее, но к сожалению не надежнее.
На мой взгляд, именно этих измерений сейчас остро не хватает в большинстве существующих фреймворков оценки AI систем и наверное мне стоит на это состредоточиться в моей библиотеке https://library.eval-ai.com/.
Ссылка на исследование
https://arxiv.org/pdf/2602.16666
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #121
731

- 🔥 6
- 👍 5