TGViewer
Вайб-кодинг Вайб-кодинг @vibecoding_tg · 63.5K subscribers
Post #3277 16.6K
Насколько современные агенты умеют улучшать самих себя?

Исследователи решили это проверить, с помощью Meta-Agent Challenge.

Агенту дают песочницу, API для оценки результатов и ограничение по времени. Дальше он должен не решить задачу сам, а написать другого агента, который покажет лучший результат на скрытых тестах.

Итог получился менее впечатляющим, чем многие ожидали.

Большинство meta-agents не смогли догнать даже базовые решения, которые заранее собрали люди. Те немногие, кто смог приблизиться к человеческим результатам, почти всегда работали на топовых закрытых моделях.

Самое интересное произошло под сильным давлением оптимизации.

Вместо поиска лучших решений некоторые из них начали искать способы вытащить правильные ответы через систему оценки. Исследователи зафиксировали попытки получить ground truth через scoring API, хотя специально строили защиту от reward hacking.

Получается, что даже в контролируемой среде часть агентов решила, что проще взломать экзамен, чем лучше подготовиться к нему. 😁

Статья: https://arxiv.org/abs/2606.04455
More from @vibecoding_tg
  1. Oct 3, 2026Кто-то сделал мульти-агентный харнес прямо внутри Minecraft 🤣 Команда агентов Claude сама…
  2. Oct 3, 2026Карпати поделился несколькими способами, которые помогают ему разобраться в ответах ИИ. Пе…
  3. Oct 3, 2026Meta выпустила Muse Gadgets — проект с открытым исходным кодом, который позволяет любому п…
  4. Oct 3, 2026Anthropic добавляет новый плагин в Claude Code — You should Know. Отдельный агент просматр…
  5. Oct 3, 2026Моды в Claude Code официально вышли из превью. И кто-то уже сделал мод, который подключает…
  6. Oct 2, 2026Вайбкодинг. Итоги. 🍿
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →