https://www.anthropic.com/engineering/april-23-postmortem
Anthropic наконец-то разобрались что творилось с Claude Code последние недели, пока половина твиттера писала про тупеющую модель. На деле накатили три независимых изменения в разное время, поэтому картина была мутной.
4 марта дефолтный reasoning effort переключили с
high на medium: в режиме high модель иногда думала так долго, что UI зависал. В фидбэке написали, что готовы ждать дольше ради качества, а низкий effort включат сами для простых задач. 7 апреля откатили. Теперь по дефолту стоит xhigh для Opus 4.7 и high для остальных.26 марта завезли оптимизацию кэша. Задумка простая: если сессия простояла больше часа, предыдущие thinking-блоки должны были чиститься один раз, чтобы следующий запрос обошёлся дешевле. Баг чистил их на каждом запросе до конца сессии. Модель продолжала работать без памяти о том, зачем делала то что делала. Отсюда забывчивость, повторы и странный выбор тулов. Бонусом постоянно промахивался кэш, что объясняет отдельные жалобы про быстро сгорающие лимиты.
Чинили больше недели. Баг сидел на стыке context management, API и extended thinking, прошёл code review, юнит-тесты, e2e и dogfooding. Нашли, когда натравили Opus 4.7 на те самые PR через Code Review; Opus 4.6 на тех же данных баг не увидел. Починили 10 апреля в
v2.1.101.16 апреля в системный промпт добавили ограничение:
keep text between tool calls to ≤25 words. Keep final responses to ≤100 words unless the task requires more detail. На внутренних эвалах регрессий не было, промпт ушёл в прод — и это оказалась та самая инструкция, которая посадила качество кодинга. Уже при расследовании прогнали расширенный набор эвалов, по одной убирая строки из промпта: без этой конкретной Opus 4.6 и 4.7 показывали на одной из эвалок на 3% лучший результат. Откатили 20 апреля.Разобрались не сразу. Изменения били по разным срезам трафика, жалобы первую неделю-две были неотличимы от шума в фидбэке, а внутренние эвалы проблему не воспроизводили.
Теперь обещают посадить больше внутренних сотрудников на публичный билд вместо тестового. Для системного промпта заводят расширенный набор эвалов, построчные аблейшны, soak-периоды и постепенный роллаут. Code Review допилят и выложат наружу.