TGViewer
AI и разработка | Кейсы, грабли и ИИ... AI и разработка | Кейсы, грабли и ИИ... @ai_in_dev · 177 subscribers
Post #102 78
Тесты зелёные, а мержить нельзя. Новый бенчмарк вскрыл проблему

Мы привыкли оценивать код, сгенерированный ИИ-агентами, по принципу «прошел/не прошел тесты». Новый бенчмарк SWE-Gate от исследователей из нескольких университетов показывает, что в реальной разработке «работает» и «готов к мержу» это очень разные вещи.

Из 644 исправлений от четырех LLM, которые успешно проходили функциональные тесты, 221 (34.3%) нарушали требования, которые обычно выявляет code review. Код технически работал, но содержал ошибки в семантике сообщений или неправильные типы данных, имел проблемы с очисткой ресурсов или не соответствовал архитектурным паттернам проекта. Все то, что не проверяется автотестами, но мгновенно цепляет глаз ревьюера.

Модели решают задачу «исправить баг», но задача разработки шире: создать поддерживаемый, консистентный код, который вписывается в контекст проекта. 
Авторы SWE-Gate предлагают явно кодифицировать «правила игры» для агентов. Если мы хотим, чтобы они генерировали код, готовый к ревью, эти требования нужно превратить в исполняемые проверки после функциональных тестов.

AI в разработке
More from @ai_in_dev
  1. Sep 25, 2026Код пишется быстрее, а релизы нет. Два взгляда на одну проблему За последние дни на Хабре…
  2. Sep 23, 2026Если AI способен написать функцию, значит ли это, что он способен вести разработку? Benchm…
  3. Sep 16, 2026Cloudflare начал различать AI-ботов Вчера, 15 сентября, Cloudflare добавил настройки для A…
  4. Sep 15, 2026AI-агенты пишут код, собирают приложения и… взламывают системы 🙃 Агенты уже не просто пом…
  5. Sep 8, 2026«Модельная усталость»: гонка, которую уже не выиграть Первая неделя сентября войдет в исто…
  6. Sep 4, 2026Архитектура для ИИ-агентов: от «магического» кода к инженерному процессу Когда мы говорим…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →