Иван Пономарев у меня старый клиент. Очень опытный коллега и как разработчик, и как менеджер.
Иван сделал себе
дашборды для оценки быстрого прогресса разработки. Как понимаю, это он делает на новых артефактах
Claude Code.
Это как раз к холивару в нашем чате, что «я запустил агента на 2–12 часов, мне написали новый
Bitrix, завтра выхожу на NASDAQ».
В реальности высокая автономность
агентов уже довольно очевидно начинает играть злую шутку с разработчиками и менеджерами.
Тут можно вспомнить «разработку»
Cursor, аж целую неделю агенты автономно писали новый
Firefox.
https://quasa.io/media/cursor-s-ai-revolution-building-a-browser-from-scratch-with-gpt-5-2-agents-in-just-one-weekВсе бы хорошо, только он никому не нужен. Дело даже не в том, что агенты сделали его совсем нерабочим, а получился «окосевший Firefox», т.к. не имея нормальной постановки задачи, агенты пытались вспомнить свой датасет, где его видели. Но в весах код у них размытый.
В реальности автономные сессии крайне опасны, и тут «ошибка выжившего» может стоить вам работы легко. Просто агент не откажется от разработки с неполным ТЗ, он сам легко сгенерирует «Полное ТЗ» на 500 страниц, но вот беда — агент начнёт сам выбирать «наиболее вероятные», т.е. фактически случайные решения во многих случаях. Где-то они подойдут, а где-то не только не подойдут, а создадут совсем кривые решения, что потребует выбросить всё и переписать заново. Таких историй от критиков ИИ, как они за уволенными «вайбкодерами» сносят их хлам в X, достаточно.
В реальности опасная тема — потерять контроль над пайплайном разработки дальше 1000 строк кода за раз или где-то 15 минут автоматической работы. Вероятность, что агенты «додумали не то», растёт просто в геометрической прогрессии. Причём чайник реагирует на успешные тесты, но вопрос в том, что агенты пишут правильный код, он работает, но делает совсем не то, что нужно пользователю или что нужно для устойчивости архитектуры долгосрочно.
Между итерациями около 15 минут вы обязаны проводить быстрый контроль. Вот тут как раз Дарио с его артефактами для
Claude Code в самую точку. Очень сложно в таком темпе, как агенты пишут спеки и код, их контролировать по тексту. Однако можно быстро собирать
дашборды, как Иван делает. Вариантов, как визуализировать множество, много, но главное нужно понять, что «энтропию текста» вокруг 1000 строк за 15 минут вы не поймёте — требуется специальная визуализация итераций.
Альтернативные решения тут — всякие
Mermaid-схемы и
дашборды через эмодзи.
Тем не менее, запускать агентов на автономные циклы на часы не на тесты, а на разработку — это разновидность сумасшествия, на мой взгляд.
Вы или получите какой-то непонятный продукт галлюцинации размером с
Bitrix или
Firefox, который даже начать использовать нельзя, либо утонете в техническом долге очень быстро.
Ботов, как и людей, нужно контролировать, а
GPT в части дрейфа требований от целей дрейфует быстрее людей — это помните всегда.
Длинные автономные циклы допустимы только для агентов тестирования на мой взгляд и то без правок кода, а для диагностики.