В статье Harness Handbook исследователи предложили отдельную «карту» agent harness: она описывает, что делает система, и связывает каждое поведение с конкретными местами в коде.
Проблема знакомая: промпты, tools, memory и execution часто размазаны по десяткам функций и файлов. Агент понимает, что нужно изменить, но легко пропускает часть реализации.
Handbook строится автоматически через static analysis + LLM, хранит три уровня детализации, связи через shared state и обновляется после изменений. Агент сначала находит нужное поведение, затем постепенно спускается до конкретного кода и перепроверяет его по актуальному репозиторию.
На задачах изменения Codex качество планов выросло с 28,3% до 38,3%, а на Terminus-2 с 26,7% до 45,6%. При этом расход planner-токенов снизился на 12,7% и 8,6% соответственно. Все 24 сравнения Recall/Precision/F1 по поиску мест для правок также улучшились.
Важно: исследование измеряло качество планов изменений, а не успешность уже выполненных патчей.
Похоже, для coding agents хороший навигатор по архитектуре иногда полезнее, чем ещё больше контекста.
Paper:
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editablehttps://arxiv.org/abs/2607.13285
