⠀
В литровой пачке Opus теперь всего 330 мл живительного ИИ.
Глава AI-команды AMD Стелла Лауренцо выложила в GitHub большой разбор того, что произошло с Claude Code после февральских обновлений.
Тезис жёсткий:
инструмент стал значительно хуже справляться со сложной инженерной работой, а глубина рассуждения просела примерно на 67%.⠀
В основе не настроение, а логи. Команда AMD прогнала анализ по 6852 session JSONL-файлам за почти три месяца: 17 871 thinking block и 234 760 tool calls. По их оценке, медианная «глубина мышления» упала примерно с 2200 символов в начале периода до 720 в конце февраля и до 560 в начале марта.
⠀
На практике это выглядит так. Раньше модель чаще шла по схеме «сначала исследовать, потом менять». В хороший период на одну правку приходилось около 6,6 чтений файлов. В деградировавший период показатель упал до 2,0. То есть модель стала заметно чаще править код, не добирая контекст.
⠀
AMD отдельно пишет, что выросли и побочные эффекты: больше циклов самопоправок, больше раздражённых сообщений от пользователей, больше ручных прерываний сессий. Ещё неприятнее экономика. По их цифрам, при почти том же числе пользовательских запросов оценочная стоимость работы подпрыгнула с $345 в феврале до $42 121 в марте, потому что агенты чаще ошибались, зацикливались и требовали повторных прогонов.
⠀
Anthropic ответил, что часть шума связана не с «отключением мозга», а с изменениями интерфейса и настройками thinking effort. Сначала включили adaptive thinking, потом поставили effort=medium как дефолт. Формально это объяснение есть. Но претензия AMD в другом: если поведение модели реально меняется, пользователи должны видеть это прозрачно, а не замечать уже по сломанным workflow.
⠀
С такой шринкфляцией для тяжёлых инженерных сценариев модели уже пора мерить не по демкам и не по первым впечатлениям, а по своим логам, read/edit ratio, частоте прерываний и реальной цене результата.
В последнее время есть возможность много сравнивать Claude Opus и GPT 5.4 в разных сценариях. И я всё больше удивляюсь, как Клод отупел, и ни на что кроме визуального дизайна (тут у них нет конкурентов) и текстов (а тут под вопросом) я Opus уже не беру.
С точки зрения бизнеса я их понять могу, косты растут, надо оптимизировать. Но допустить такое падение качества — это очень недальновидно с их стороны.
Кстати, рост выручки Anthropic в несколько раз за месяц — как раз следствие такой "оптимизации", когда пользователю приходится несколько раз всё переделывать из-за того, что модель стала тупой, и расходы на токены растут по экспоненте.
📎 GitHub issue
📎 Biggo summary
