Factory и HumanLayer: сколько самостоятельности отдавать агентам (Рубрика #AI4SDLC)
Посмотрел интересное видео доклада Tereza Tížková, которая занимается развитием Factory. Она выступала на AI Engineer World’s Fair 30 июня, а отдельная запись вышла 27 сентября. Здесь разговор уже про то, как вокруг агентов организовать разработку целиком. Это видео продолжает линию, когда в мае я уже разбирал доклад Luke Alvoeiro из Factory про их агента Droid и режим Missions. Там работа поделена между агентами: одни планируют, другие пишут код, третьи проверяют результат. Причём условия готовности записываются до реализации, а проверяющий не должен быть автором кода.
Если возвращаться к свежему докладу Терезы, то по ее мысли software factory должна собирать обратную связь, выбирать задачи, выполнять их, проверять результат и запускать следующий круг. Для этого нужны три вещи: возможность менять модели и инструменты, долгая самостоятельная работа агентов и накопление знаний о проекте. Человек задаёт направление и решает, что стоит строить.
К знакомой схеме здесь добавляются несколько полезных деталей.
🔸 Деньги
В Factory модель подбирают под задачу: выбирают самую дешёвую из тех, которые, по оценке системы, должны справиться. При необходимости можно перейти на более сильную. Для длинной работы важно понимать, сколько стоит весь путь до принятого результата, включая проверки и повторные попытки.
🔸 Контекст
Описания всех подключённых инструментов могут забить агенту память ещё до начала работы. Factory сначала показывает короткий каталог, а подробности подгружает по необходимости. По данным компании, в исследованных сессиях с использованием MCP это сократило входные токены в среднем примерно на 15%. В группе со 100+ инструментами, чьи описания загружались по мере надобности, средняя экономия была около 51%. Так что эффект сильно зависит от того, сколько всего подключено.
🔸 Подготовка команды
Документация, тесты, понятный способ запустить проект и записанные правила работы нужны и агентам. Если сборку умеет запускать только один человек, а важные договорённости живут в переписке, агенту придётся разбираться с этим заново. У Factory такая проверка готовности называется Agent Readiness.
И здесь интересно вспомнить Dex Horthy и его Why Software Factories Fail. Dex тоже делает инструменты для агентной разработки. Его HumanLayer — среда, где команда обсуждает планы агентов и проверяет изменения кода.
У него другой акцент: проходящие тесты ещё не говорят, насколько легко будет менять систему через полгода. Поэтому Dex предлагает заранее обсуждать требования, архитектуру и устройство кода, а затем двигаться небольшими проверяемыми частями. При этом Dex признаёт: убедительно доказать, что агенты со временем делают код сложнее для сопровождения, он пока не может.
Factory показывает, как организовать самостоятельную работу агентов и проверку результата. Dex подробнее разбирает то, что сложнее проверить тестами: устройство кода и способность команды дальше его менять. У обоих есть свой продукт и свой интерес в этом разговоре. Я бы совмещал эти подходы: автоматизировать исполнение, а важные решения об устройстве системы обсуждать до того, как агент напишет код.
Я бы забрал отсюда три практические вещи:
1️⃣ Инженеру
Перед запуском агента записать, что должно работать и как это проверить. После — убедиться, что можешь объяснить ключевые решения в полученном коде.
2️⃣ Платформенной команде
Взять один репозиторий и проверить, может ли агент сам поднять окружение, найти правила проекта и запустить тесты. Каждую ручную подсказку стоит разобрать: чего не хватает в документации или инструментах?
3️⃣ Руководителю
На небольшой задаче посчитать стоимость готового изменения: модели, проверки, переделки и время людей. Сравнить с прежним процессом и отдельно посмотреть, что произошло с качеством.
#AI4SDLC #AI #Agents #Engineering #Management
Post #5030
1.16K