Если AI способен написать функцию, значит ли это, что он способен вести разработку?
Benchmark'и для сравнения AI coding tools начинают меняться.
Google выпустил Android Bench 2.0 и добавил задачи, которые требуют от AI-агента нескольких дней работы: обновить зависимости, добавить крупную функцию, собрать приложение с нуля или перенести его с другой платформы.
Причем теперь оценивается не только итоговый pass/fail, но и степень выполнения задачи.
Результаты показывают, что написать новый код агентам пока проще, чем разобраться в существующей системе.
На сложных долгих задачах лучший результат по pass rate составил около 28%, тогда как на исходном наборе задач Android Bench он был около 91%.
Особенно тяжело даются рефакторинг, миграции, runtime-проблемы и изменения, которые требуют понимания архитектуры, а не просто генерации большого объема кода.
Похожую проблему пытается измерить новый benchmark Real-SWE, где AI-агенты работают не с публичными учебными репозиториями, а с приватными production-кодовыми базами реальных компаний.
В задачах есть биллинг, налоги, миграция клиентов и изменения сразу в нескольких сервисах.
То есть агенту нужно понять существующую архитектуру, бизнес-логику и правила конкретной команды.
Это важный сдвиг в оценке AI для разработки, ведь живой человек работает не в пустом репозитории, много времени уходит на чтение чужого кода, поиск зависимостей, проверку предположений и понимание, почему система устроена именно так.
Исследователи Google Research проанализировали 91 набор правил для coding agents и провели интервью с 15 опытными разработчиками, чтобы понять, каким должно быть поведение AI-агента в реальной инженерной команде.
В результате выделили четыре ключевых требования:
• соблюдать стандарты и процессы,
• обеспечивать качество и надёжность кода,
• эффективно решать задачи,
• уметь сотрудничать с разработчиком, а не просто выдавать готовый результат.
Получается, что для профессиональной разработки уже недостаточно измерять агента только по принципу «написал ли он рабочий код». Важным становится, как именно агент работает внутри инженерного процесса, следует ли правилам проекта, объясняет ли свои действия, взаимодействует ли с человеком и помогает ли поддерживать качество системы на дистанции.
AI в разработке
Post #105
40