Пройти кодинг-тест один раз — легко. Поддерживать этот код 8 месяцев, чтобы он не развалился? Для AI почти невозможно.
Alibaba протестировали 18 AI-агентов на 100 реальных кодовых базах в течение 233 дней. Смотрели не на «быстрые фиксы», а на долгосрочную стабильность.
Результаты впечатлили:
— 75% моделей ломали уже работающий код в процессе поддержки
— Только Claude Opus 4.5/4.6 держали >50% zero-regression rate
— Все остальные накапливали техдолг, который в итоге «ронял» кодовую базу
Проблема в том, что мы до сих пор ориентировались на snapshot-бенчмарки вроде HumanEval — «работает ли сейчас?»
Новый бенчмарк SWE-CI задаёт другой вопрос:
«А будет ли это работать через 8 месяцев эволюции?»
Большинство AI-агентов - это quick-fix артисты:
код проходит тесты сегодня, но завтра превращается в боль поддержки.
Они не строят софт, они скорее строят карточный домик.
Нарратив стал честнее: писать код могут почти все модели. поддерживать - почти ни одна.
👉 @PythonPortal
