В новой работе представили Harness-of-Harness (HoH) - надстройку над coding-агентами, которая превращает их работу в повторяющиеся циклы:
планирование → код → тесты → оценка → улучшениеГлавная идея — не просто дать агенту одну большую задачу, а заставить его постоянно улучшать проект небольшими проверяемыми шагами, сохранять историю версий и отделять собственные тесты от независимой оценки.
На GameCraft-Bench, FrontierSWE и ProgramBench подход протестировали с несколькими связками:
- Codex + GPT-5.5
- OpenCode + DeepSeek-V4-Pro
- Pi + MiniMax-M3
После трёх итераций HoH в среднем улучшил результат на 52,25%, а максимальный прирост достиг 82,86% по сравнению с обычным запуском тех же агентов.
Самый показательный эксперимент длился более 70 итераций несколько дней подряд. Агент автономно собрал полноценный FPS: сюжет, основные механики, играбельный геймплей, визуал и звук.
То есть речь уже не о «написать функцию по промпту», а о попытке построить цикл, в котором coding-агент самостоятельно развивает один проект часами и днями.
https://arxiv.org/abs/2609.01481
