AutoAgent хочет сам улучшать агентов
⠀
Kevin Gu открыл исходники AutoAgent — библиотеки, которая не просто запускает агента на задаче, а автономно улучшает его harness под конкретный домен. Идея в том, что meta-agent сам меняет промпты, инструменты и оркестрацию, прогоняет evals, читает failure traces и оставляет только то, что реально поднимает результат.
⠀
Заявка сильная: после 24+ часов такой оптимизации AutoAgent показал 96.5% на SpreadsheetBench и 55.1% на TerminalBench. Автор утверждает, что это лучшие результаты в таблицах, и важный момент тут в другом: остальные записи были руками дотюнены людьми, а здесь тюнинг делал сам агент.
⠀
Самая интересная мысль в статье — не про очередной benchmark, а про «model empathy». Авторы пишут, что агенту проще улучшать другого агента той же модели, потому что он лучше понимает его слабые места, типичные срывы и то, какие инструменты ему действительно подходят. Поэтому связка Claude meta-agent + Claude task agent у них оказалась сильнее, чем Claude meta-agent + GPT task agent.
⠀
Если это направление взлетит, то главный дефицит в agentic-системах сместится. Узким местом станет уже не написание одного хорошего агента, а управление флотом узкоспециализированных агентов, которые сами себя подстраивают под домен.
⠀
И это уже похоже не на красивую демку, а на раннюю инфраструктуру для agent fleets.
⠀
—
📎 X Article · GitHub
Post #155
215

- ❤ 1