TGViewer
Книжный куб Книжный куб @book_cube · 15.8K subscribers
Post #5043 1.33K
Annotated_Harness_design_for_long_running_application_development.pdf5.1 MB
Проектирование обвязки для длительной (автономной) разработки приложений (Рубрика #AI4SDLC)

В 33 выпуске Research Insights Made Simple мы разбирали SWE-agent: как интерфейс, инструменты и обратная связь меняют результат той же модели. В 34 выпуске — как передавать работу между сессиями, сохраняя список функций, прогресс и проверенное состояние проекта. В 35 выпуске мы говорили про подход OpenAI к созданию harness, а в этой статье "Harness design for long-running application development" Притви Раджасекарана идет речь про подход к снаряду ребят из Anthropic. По-факту, тут переход от рабочего места и памяти агента к организации автономной one-shot разработки целого приложения.

У LLM с самооценкой легко получается «кукушка хвалит петуха»: написала что-то, сама проверила и решила, что всё отлично. Автор разделяет создание и оценку результата. В полной версии harness появляются три роли:
1) Planner разворачивает короткий запрос в продуктовую спецификацию.
2) Generator реализует приложение.
3) Evaluator проверяет работающую систему через браузер, API и состояние базы.

По-моему, это уже очень похоже на команду с product manager, разработчиком и QA. Особенно интересен контракт спринта: до написания кода агенты согласуют, что должно получиться и как проверить готовность. Спецификация остаётся достаточно общей, а критерии приёмки связывают её с реализацией.

При этом отдельный критик тоже требует настройки. Автор разбирал его логи и учил строже относиться к найденным проблемам. Для дизайна — задавал критерии цельности, оригинальности, качества исполнения и удобства, затем калибровал оценки на примерах. Здесь меня интересует граница: насколько можно формализовать вкус? Оценщик способен всё увереннее попадать в заданные предпочтения, но рост баллов ещё не гарантирует, что следующая версия понравится человеку больше предыдущей.

Цена такого процесса тоже заметная. В примере редактора игр одиночный запуск стоил $9 и занял 20 минут, полный harness — $200 и шесть часов. По описанию автора, во втором случае заработал игровой режим. Но одновременно выросли бюджет, время и объём задания, поэтому вклад самого разделения ролей этим сравнением не изолирован.

А дальше начинается самая полезная для инженеров часть: harness упрощают по мере усиления модели. На Opus 4.5 автор смог убрать явные сбросы контекста; на 4.6 — спринты, оставив проверку после сборки и циклы исправлений. Уже знакомый поворот из истории SWE-agent: части обвязки могут перестать быть нужными.

Каждый такой элемент фиксирует предположение о слабости модели. Поэтому после её обновления стоит снова проверять, зачем нам эта передача работы, эта роль, этот промежуточный этап. Удалять их по одному и смотреть, что происходит с качеством, временем и стоимостью.

И тут у меня следующий вопрос: сможет ли агент сам улучшать собственный harness — менять процесс, проверять результат и убирать лишнее? Звучит как естественное продолжение, но тогда особенно важно понять, кто будет оценивать самого оценщика.

9 октября в 9:00 по Москве разберём эту статью в прямом эфире Research Insights Made Simple. Обсудим устройство процесса, пользу отдельной приёмки и то, что останется от обвязки с усилением моделей. Приходите!

#AI4SDLC #Agents #Engineering #Research #Evals
  • 🔥 6
  • ❤ 2
  • 👍 1
More from @book_cube
  1. Oct 9, 2026Заходите на прямой эфир Research Insights - сегодня серия с обсуждением мартовской статьи…
  2. Oct 9, 2026По традиции я раз в год участвую в благотворительной акции с механикой аукциона, где можно…
  3. Oct 8, 2026Материалы Code of Leadership №84: разработчик становится менеджером в эпоху AI? (Рубрика #…
  4. Oct 8, 2026Материалы выпуска Research Insights #33: SWE-agent (Рубрика #AI4SDLC) Собрал материалы сол…
  5. Oct 8, 2026Justin Reock: код менять легче, деплоить страшнее (Рубрика #AI4SDLC) Новый доклад Justin R…
  6. Oct 7, 2026Зачем руководитель возвращается к коду — материалы выпуска (Рубрика #Leadership) Вышел 82-…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →