Автономные AI-разработчики на практике: разбираемся на примере Devin
Devin может сам изучить проект, найти причину бага, изменить код, запустить тесты и принести готовый pull request. Со стороны выглядит почти идеально: задача выполнена, проверки зелёные - значит можно принимать.
Но здесь есть неприятный нюанс: ИИ может ошибиться не только в коде, но и в способе его проверки. Например, вместе с исправлением изменить тест так, что тот начнёт подтверждать неправильное поведение.
🤖🤖🤖
Поэтому при работе с автономными агентами появляется новый навык - это не столько писать код самому, сколько уметь принимать чужой результат. Посмотреть, какие файлы изменились, прочитать diff, повторно запустить проверки и вручную воспроизвести исходную проблему.
В статье разобрали это на конкретном примере с Devin: от получения задачи до момента, когда результат действительно можно считать проверенным.
Подробнее в статье на vc →
Post #519
235