Для Research Insights Made Sijmple #34 разбираю "Effective harnesses for long-running agents" — инженерный пост Джастина Янга из Anthropic почти годовалой давности (26 ноября 2025 года). Меня зацепил вопрос: что останется от работы агента, когда закончится его контекст и следующей сессии придется продолжать проект?
В этой статье Anthropic описывает опыт сборки клона claude.ai. Агент пытался сделать слишком много за один заход, оставлял недоделанную функцию без понятного описания, а следующий экземпляр тратил время на восстановление. Или видел уже написанный код и радостно объявлял весь проект готовым. Сжатие истории разговора само по себе эти проблемы не устраняло.
Получается разработка со сменами: каждый новый инженер приходит без памяти о предыдущем. Оставить ему «я тут поработал, все почти готово» — так себе передача дел :)
Авторы собирают протокол вокруг нескольких вещей:
— Инициализатор готовит среду, скрипт запуска и список функций с критериями проверки. Изначально все функции помечены как неготовые.
— Следующие сессии берут по одной функции, проверяют результат, сохраняют изменения в Git и обновляют журнал прогресса.
— В начале новой сессии агент читает журнал и историю коммитов, проверяет, что приложение работает, и выбирает следующую задачу.
— Для веб-приложения проверка включает сценарии в браузере. Код может выглядеть убедительно, пока пользователь не нажмет кнопку.
Кстати, «два агента» здесь — две фазы с разными стартовыми промптами. В сноске авторы уточняют, что системный промпт, инструменты и обвязка одинаковы. Доказательств пользы роя из этого не получается. Еще любопытная деталь: по наблюдению авторов, агент реже нежелательно переписывал список требований в JSON, чем в Markdown. Чисел и условий сравнения нет, так что я бы считал это гипотезой для проверки. Тем более JSON сам по себе ничего не запрещает: если важно сохранить требования, нужно отдельно проверять изменения. Просьба «не меняй тесты» технического ограничения не создает.
Меня здесь интересует разница между сохраненным рассказом о работе и проверенным состоянием проекта. Журнал помогает понять намерение, Git — увидеть изменения, список функций — вспомнить обязательства, а тесты — проверить результат. У каждого артефакта своя роль. Галочка
passes: true, которую агент поставил себе сам, без надежной проверки остается его мнением.Называть этот пост научным прорывом я бы не стал: это опыт команды производителя на веб-разработке, без контрольной группы и количественных сравнений. Зато он хорошо показывает, сколько обычной инженерной дисциплины требуется, чтобы агент мог продолжать большую задачу.
И рецепт меняется вместе с моделью. В продолжении от марта 2026 года Anthropic описала отдельного оценщика и отказ от принудительных сбросов контекста при переходе с Sonnet 4.5 на Opus 4.5. Полезно разбирать, какую конкретную слабость компенсирует каждый элемент обвязки и нужен ли он в следующей конфигурации.
Завтра, 7 октября, в прямом эфире Research Insights #34 подробнее поговорим про эту статью: как передавать работу между сессиями, чему доверять в отчете агента и когда разделение ролей действительно помогает. Приходите, будет что обсудить.
#AI4SDLC #AI #Agents #Engineering #Research