Проектирование обвязки для длительной (автономной) разработки приложений (Рубрика #AI4SDLC)
В 33 выпуске Research Insights Made Simple мы разбирали SWE-agent: как интерфейс, инструменты и обратная связь меняют результат той же модели. В 34 выпуске — как передавать работу между сессиями, сохраняя список функций, прогресс и проверенное состояние проекта. В 35 выпуске мы говорили про подход OpenAI к созданию harness, а в этой статье "Harness design for long-running application development" Притви Раджасекарана идет речь про подход к снаряду ребят из Anthropic. По-факту, тут переход от рабочего места и памяти агента к организации автономной one-shot разработки целого приложения.
У LLM с самооценкой легко получается «кукушка хвалит петуха»: написала что-то, сама проверила и решила, что всё отлично. Автор разделяет создание и оценку результата. В полной версии harness появляются три роли:
1) Planner разворачивает короткий запрос в продуктовую спецификацию.
2) Generator реализует приложение.
3) Evaluator проверяет работающую систему через браузер, API и состояние базы.
По-моему, это уже очень похоже на команду с product manager, разработчиком и QA. Особенно интересен контракт спринта: до написания кода агенты согласуют, что должно получиться и как проверить готовность. Спецификация остаётся достаточно общей, а критерии приёмки связывают её с реализацией.
При этом отдельный критик тоже требует настройки. Автор разбирал его логи и учил строже относиться к найденным проблемам. Для дизайна — задавал критерии цельности, оригинальности, качества исполнения и удобства, затем калибровал оценки на примерах. Здесь меня интересует граница: насколько можно формализовать вкус? Оценщик способен всё увереннее попадать в заданные предпочтения, но рост баллов ещё не гарантирует, что следующая версия понравится человеку больше предыдущей.
Цена такого процесса тоже заметная. В примере редактора игр одиночный запуск стоил $9 и занял 20 минут, полный harness — $200 и шесть часов. По описанию автора, во втором случае заработал игровой режим. Но одновременно выросли бюджет, время и объём задания, поэтому вклад самого разделения ролей этим сравнением не изолирован.
А дальше начинается самая полезная для инженеров часть: harness упрощают по мере усиления модели. На Opus 4.5 автор смог убрать явные сбросы контекста; на 4.6 — спринты, оставив проверку после сборки и циклы исправлений. Уже знакомый поворот из истории SWE-agent: части обвязки могут перестать быть нужными.
Каждый такой элемент фиксирует предположение о слабости модели. Поэтому после её обновления стоит снова проверять, зачем нам эта передача работы, эта роль, этот промежуточный этап. Удалять их по одному и смотреть, что происходит с качеством, временем и стоимостью.
И тут у меня следующий вопрос: сможет ли агент сам улучшать собственный harness — менять процесс, проверять результат и убирать лишнее? Звучит как естественное продолжение, но тогда особенно важно понять, кто будет оценивать самого оценщика.
9 октября в 9:00 по Москве разберём эту статью в прямом эфире Research Insights Made Simple. Обсудим устройство процесса, пользу отдельной приёмки и то, что останется от обвязки с усилением моделей. Приходите!
#AI4SDLC #Agents #Engineering #Research #Evals
Post #5043
1.33K