TGViewer
Код Меркури Код Меркури @mercdev · 2.06K subscribers
Post #6716 681
👀 ИИ пишут чисто, поддерживают грязно

Alibaba протестировала 18 ИИ-агентов в симуляции реальной разработки:
• 100 настоящих кодовых баз;
• каждая кодовая база — 233 дня разработки;
• каждая задача — 71 последовательный коммит реального развития кода.

Цель эксперимента — понять могут ли ИИ-агенты поддерживать код на протяжении 8 месяцев, не ломая старое.

Для этого Alibaba сделала новый бенчмарк SWE-CI, который проверяет не починила ли нейросеть баг один раз, а как код переживает эволюцию проекта в целом.

Итог не очень:
75% моделей при внесении изменений ломают ранее работавший функционал и накапливают техдолг с каждой новой правкой.


Нормально справились только Claude Opus 4.5 и 4.6. Они смогли удержать планку выше 50% zero-regression rate.

Остальные модели показали, что пока они хороши только для генерации сниппетов «с нуля». Как только дело доходит до долгосрочной поддержки и эволюции проекта, модели теряют контекст и превращают кодовую базу в хаос.
  • 🔥 5
  • 👍 3
  • 🤯 1
More from @mercdev
  1. Oct 2, 2026Коллеги, если в пятницу уже очень хочется исчезнуть с работы — попробуйте расширение Snap…
  2. Sep 28, 2026Поправили мем, а то чего-то в нем явно не хватало 😏 У нас все проще: можно откликнуться н…
  3. Sep 25, 2026Факт №222 из меркурианского лора: частичка нашей работы есть в клипе Coldplay. Сколько лет…
  4. Sep 25, 2026Если слышите что-то меланхоличное и космическое, значит это Coldplay Ребята всегда заставл…
  5. Sep 25, 2026Post #6922
  6. Sep 9, 2026Чувствуете, как акции Subway Surfers растут в цене?
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →