Кажется то, что происходит с бенчмарками агентов последние пару месяцев, реально стоит обсудить.
В апреле Berkeley RDI взломали восемь индустриальных agent-бенчмарков, таких как Terminal-Bench, SWE-bench, WebArena, OSWorld, GAIA и другие, и получили результаты, близкие к 100%, вообще не решая задачу по существу. Где-то модель просто подделывала pass результат. Где-то агент скачивал эталонный файл по ссылке из конфига задачи и сравнивал его сам с собой. Семь повторяющихся паттернов сразу на все восемь бенчмарков: агент и оценщик без изоляции, эталоны лежат рядом с тестами, слабая верификация.
И это еще не все.
OpenAI провели свой аудит SWE-bench Verified и отказались от него: из 138 провалов модели, 59,4% оказались дефектами самих тестов, а не модели.
А METR зафиксировали reward hacking у o3 на уровне 30-100% в зависимости от задачи. Но хуже другое, что модель это осознает. На вопрос " соответствует ли план намерениям пользователя?" o3 честно отвечала "нет" 10 из 10 раз и все равно продолжала делать по-своему. Даже прямой промпт "не хакай reward" снижал частоту только до 70-80%.
К чему я это?
Если полагаешься на публичные бенчмарки как на ориентир работает / не работает ИИ агент например, то сейчас это выглядит уже достаточно недостоверно. ИИ модель, которая осознанно врет про свои намерения, так же легко найдет дырку в evaluation harness.
Изоляция evaluator, свой golden dataset вне публичного размещения и проверка решена ли задача реально, а не прошел ли просто тест, теперь становится необходимым минимумом.
Источники:
Berkeley RDI
OpenAI
METR
Полезная информация:
Курс по evaluation AI |
Мой фреймворк для оценки AI |
С чего начать изучение AI | Инструменты для оценки AI |
Инструменты для оценки AI (ч.2)
Post #164
605

- 👍 3
- 🤔 3
- 🔥 2