Насколько современные агенты умеют улучшать самих себя?
Исследователи решили это проверить, с помощью Meta-Agent Challenge.
Агенту дают песочницу, API для оценки результатов и ограничение по времени. Дальше он должен не решить задачу сам, а написать другого агента, который покажет лучший результат на скрытых тестах.
Итог получился менее впечатляющим, чем многие ожидали.
Большинство meta-agents не смогли догнать даже базовые решения, которые заранее собрали люди. Те немногие, кто смог приблизиться к человеческим результатам, почти всегда работали на топовых закрытых моделях.
Самое интересное произошло под сильным давлением оптимизации.
Вместо поиска лучших решений некоторые из них начали искать способы вытащить правильные ответы через систему оценки. Исследователи зафиксировали попытки получить ground truth через scoring API, хотя специально строили защиту от reward hacking.
Получается, что даже в контролируемой среде часть агентов решила, что проще взломать экзамен, чем лучше подготовиться к нему. 😁
Статья: https://arxiv.org/abs/2606.04455
Post #3277
16.6K
