TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #5036 768
Annotated-Effective-harnesses-for-long-running-agents.pdf2 MB
Обвязка агента по Anthropic: как передавать работу между кодинговыми сессиями (Рубрика #AI4SDLC)

Для Research Insights Made Sijmple #34 разбираю "Effective harnesses for long-running agents" — инженерный пост Джастина Янга из Anthropic почти годовалой давности (26 ноября 2025 года). Меня зацепил вопрос: что останется от работы агента, когда закончится его контекст и следующей сессии придется продолжать проект?

В этой статье Anthropic описывает опыт сборки клона claude.ai. Агент пытался сделать слишком много за один заход, оставлял недоделанную функцию без понятного описания, а следующий экземпляр тратил время на восстановление. Или видел уже написанный код и радостно объявлял весь проект готовым. Сжатие истории разговора само по себе эти проблемы не устраняло.

Получается разработка со сменами: каждый новый инженер приходит без памяти о предыдущем. Оставить ему «я тут поработал, все почти готово» — так себе передача дел :)

Авторы собирают протокол вокруг нескольких вещей:

— Инициализатор готовит среду, скрипт запуска и список функций с критериями проверки. Изначально все функции помечены как неготовые.
— Следующие сессии берут по одной функции, проверяют результат, сохраняют изменения в Git и обновляют журнал прогресса.
— В начале новой сессии агент читает журнал и историю коммитов, проверяет, что приложение работает, и выбирает следующую задачу.
— Для веб-приложения проверка включает сценарии в браузере. Код может выглядеть убедительно, пока пользователь не нажмет кнопку.

Кстати, «два агента» здесь — две фазы с разными стартовыми промптами. В сноске авторы уточняют, что системный промпт, инструменты и обвязка одинаковы. Доказательств пользы роя из этого не получается. Еще любопытная деталь: по наблюдению авторов, агент реже нежелательно переписывал список требований в JSON, чем в Markdown. Чисел и условий сравнения нет, так что я бы считал это гипотезой для проверки. Тем более JSON сам по себе ничего не запрещает: если важно сохранить требования, нужно отдельно проверять изменения. Просьба «не меняй тесты» технического ограничения не создает.

Меня здесь интересует разница между сохраненным рассказом о работе и проверенным состоянием проекта. Журнал помогает понять намерение, Git — увидеть изменения, список функций — вспомнить обязательства, а тесты — проверить результат. У каждого артефакта своя роль. Галочка passes: true, которую агент поставил себе сам, без надежной проверки остается его мнением.

Называть этот пост научным прорывом я бы не стал: это опыт команды производителя на веб-разработке, без контрольной группы и количественных сравнений. Зато он хорошо показывает, сколько обычной инженерной дисциплины требуется, чтобы агент мог продолжать большую задачу.

И рецепт меняется вместе с моделью. В продолжении от марта 2026 года Anthropic описала отдельного оценщика и отказ от принудительных сбросов контекста при переходе с Sonnet 4.5 на Opus 4.5. Полезно разбирать, какую конкретную слабость компенсирует каждый элемент обвязки и нужен ли он в следующей конфигурации.

Завтра, 7 октября, в прямом эфире Research Insights #34 подробнее поговорим про эту статью: как передавать работу между сессиями, чему доверять в отчете агента и когда разделение ролей действительно помогает. Приходите, будет что обсудить.

#AI4SDLC #AI #Agents #Engineering #Research
  • ❤ 2
  • 👍 2
  • 🔥 1
More from @book_cube
  1. Oct 6, 2026Забегаайте на прямой эфир с Андреем Димтриевым из JUG.RU, где мы обсудим, что сейчас разра…
  2. Oct 6, 2026Conductor: как управлять оркестром агентов (Рубрика #AI4SDLC) В разборе «Несведущего маэст…
  3. Oct 5, 2026Материалы выпуска: как инженер учится договариваться — Сергей Киселёв (Рубрика #Leadership…
  4. Oct 5, 2026SWE-agent: как интерфейс помогает модели работать с кодом (Рубрика #AI4SDLC) В Research In…
  5. Oct 5, 2026SWE-agent или как интерфейс меняет результат / Research Insights Made Simple #33 (Рубрика…
  6. Oct 5, 2026Factory и HumanLayer: сколько самостоятельности отдавать агентам (Рубрика #AI4SDLC) Посмот…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →