Alibaba протестировала 18 ИИ-агентов в симуляции реальной разработки:
• 100 настоящих кодовых баз;
• каждая кодовая база — 233 дня разработки;
• каждая задача — 71 последовательный коммит реального развития кода.
Цель эксперимента — понять могут ли ИИ-агенты поддерживать код на протяжении 8 месяцев, не ломая старое.
Для этого Alibaba сделала новый бенчмарк SWE-CI, который проверяет не починила ли нейросеть баг один раз, а как код переживает эволюцию проекта в целом.
Итог не очень:
75% моделей при внесении изменений ломают ранее работавший функционал и накапливают техдолг с каждой новой правкой.
Нормально справились только Claude Opus 4.5 и 4.6. Они смогли удержать планку выше 50% zero-regression rate.
Остальные модели показали, что пока они хороши только для генерации сниппетов «с нуля». Как только дело доходит до долгосрочной поддержки и эволюции проекта, модели теряют контекст и превращают кодовую базу в хаос.
