Claude выпустили postmortem по следам возмущений коммьюнити деградацией Opus 4.6
Postmortem - процедура детального анализа проблемы - "вскрытие\аутопсия", букв. "после смерти"
Anthropic выявила три независимые причины.
Первая — 4 марта уровень рассуждений по умолчанию был снижен с high до medium для сокращения задержек, что сделало модель менее «умной»; изменение откатили 7 апреля.
Вторая — 26 марта появился баг в оптимизации кэширования: вместо однократной очистки истории рассуждений после часа простоя сессии это происходило на каждом шагу, из-за чего Claude «забывал» контекст, повторялся и делал странные вызовы инструментов; исправлено 10 апреля .
Третья — 16 апреля в системный промпт добавили ограничение на длину ответов (≤25 слов между вызовами инструментов, ≤100 слов итого), что снизило качество написания кода на 3%; откатили 20 апреля.
Это прошло мимо кодревью, юнит-тестов, e2e-тестов и догфудинга, потому что проявлялось только в «угасших» сессиях, которые, очевидно, никто внутри не тестировал.
Догфудинг (от англ. "eating your own dog food") — практика, когда сотрудники компании сами используют собственный продукт в реальных условиях, как обычные пользователи.
Ну вы поняли, пользователи - собаки, лол.
Итог предсказуем: три независимых изменения одновременно ухудшали продукт, пока пользователи месяц постили жалобы, а внутренние метрики «не воспроизводили проблему» .
В конце постмортема — традиционное «мы всё исправили, имплементируем новые процессы и очень-очень ценим ваш фидбэк», плюс символический сброс лимитов для подписчиков.
Оригинал оправданий на английском можно почитать тут
Post #2118
278
Full-time nerd Я не успел привыкнуть к Opus 4.6, как вышел Opus 4.7 Как обычно - быстрее, выше, сильнее, контекстнее, кибербезопаснее, умнее. Для разработчиков внедрили новый уровень контроля рассуждений xhigh (между high и max) и бета-версию «бюджетов задач» в API для…

- 👍 5
- 😁 5