TGViewer
AI и разработка | Кейсы, грабли и ИИ... AI и разработка | Кейсы, грабли и ИИ... @ai_in_dev · 177 subscribers
Post #105 40
Если AI способен написать функцию, значит ли это, что он способен вести разработку? 

Benchmark'и для сравнения AI coding tools начинают меняться. 
Google выпустил Android Bench 2.0 и добавил задачи, которые требуют от AI-агента нескольких дней работы: обновить зависимости, добавить крупную функцию, собрать приложение с нуля или перенести его с другой платформы.
Причем теперь оценивается не только итоговый pass/fail, но и степень выполнения задачи. 

Результаты показывают, что написать новый код агентам пока проще, чем разобраться в существующей системе.
На сложных долгих задачах лучший результат по pass rate составил около 28%, тогда как на исходном наборе задач Android Bench он был около 91%. 

Особенно тяжело даются рефакторинг, миграции, runtime-проблемы и изменения, которые требуют понимания архитектуры, а не просто генерации большого объема кода. 

Похожую проблему пытается измерить новый benchmark Real-SWE, где AI-агенты работают не с публичными учебными репозиториями, а с приватными production-кодовыми базами реальных компаний. 
В задачах есть биллинг, налоги, миграция клиентов и изменения сразу в нескольких сервисах.
То есть агенту нужно понять существующую архитектуру, бизнес-логику и правила конкретной команды.

Это важный сдвиг в оценке AI для разработки, ведь живой человек работает не в пустом репозитории, много времени уходит на чтение чужого кода, поиск зависимостей, проверку предположений и понимание, почему система устроена именно так.

Исследователи Google Research проанализировали 91 набор правил для coding agents и провели интервью с 15 опытными разработчиками, чтобы понять, каким должно быть поведение AI-агента в реальной инженерной команде. 

В результате выделили четыре ключевых требования: 
• соблюдать стандарты и процессы,
• обеспечивать качество и надёжность кода, 
• эффективно решать задачи,
• уметь сотрудничать с разработчиком, а не просто выдавать готовый результат.

Получается, что для профессиональной разработки уже недостаточно измерять агента только по принципу «написал ли он рабочий код». Важным становится, как именно агент работает внутри инженерного процесса, следует ли правилам проекта, объясняет ли свои действия, взаимодействует ли с человеком и помогает ли поддерживать качество системы на дистанции.

AI в разработке
More from @ai_in_dev
  1. Sep 25, 2026Код пишется быстрее, а релизы нет. Два взгляда на одну проблему За последние дни на Хабре…
  2. Sep 16, 2026Cloudflare начал различать AI-ботов Вчера, 15 сентября, Cloudflare добавил настройки для A…
  3. Sep 15, 2026AI-агенты пишут код, собирают приложения и… взламывают системы 🙃 Агенты уже не просто пом…
  4. Sep 11, 2026Тесты зелёные, а мержить нельзя. Новый бенчмарк вскрыл проблему Мы привыкли оценивать код,…
  5. Sep 8, 2026«Модельная усталость»: гонка, которую уже не выиграть Первая неделя сентября войдет в исто…
  6. Sep 4, 2026Архитектура для ИИ-агентов: от «магического» кода к инженерному процессу Когда мы говорим…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →