TGViewer
Max Syabro and a Slop Driven Development Max Syabro and a Slop Driven Development @syabro_notes · 954 subscribers
Post #755 530
TLDR: за месяц в Claude Code вылезли три независимых бага, которые вместе выглядели как деградация модели. API они не затронули. Всё починили к 20 апреля, подписчикам сбросили usage limits.

https://www.anthropic.com/engineering/april-23-postmortem

Anthropic наконец-то разобрались что творилось с Claude Code последние недели, пока половина твиттера писала про тупеющую модель. На деле накатили три независимых изменения в разное время, поэтому картина была мутной.

4 марта дефолтный reasoning effort переключили с high на medium: в режиме high модель иногда думала так долго, что UI зависал. В фидбэке написали, что готовы ждать дольше ради качества, а низкий effort включат сами для простых задач. 7 апреля откатили. Теперь по дефолту стоит xhigh для Opus 4.7 и high для остальных.

26 марта завезли оптимизацию кэша. Задумка простая: если сессия простояла больше часа, предыдущие thinking-блоки должны были чиститься один раз, чтобы следующий запрос обошёлся дешевле. Баг чистил их на каждом запросе до конца сессии. Модель продолжала работать без памяти о том, зачем делала то что делала. Отсюда забывчивость, повторы и странный выбор тулов. Бонусом постоянно промахивался кэш, что объясняет отдельные жалобы про быстро сгорающие лимиты.

Чинили больше недели. Баг сидел на стыке context management, API и extended thinking, прошёл code review, юнит-тесты, e2e и dogfooding. Нашли, когда натравили Opus 4.7 на те самые PR через Code Review; Opus 4.6 на тех же данных баг не увидел. Починили 10 апреля в v2.1.101.

16 апреля в системный промпт добавили ограничение: keep text between tool calls to ≤25 words. Keep final responses to ≤100 words unless the task requires more detail. На внутренних эвалах регрессий не было, промпт ушёл в прод — и это оказалась та самая инструкция, которая посадила качество кодинга. Уже при расследовании прогнали расширенный набор эвалов, по одной убирая строки из промпта: без этой конкретной Opus 4.6 и 4.7 показывали на одной из эвалок на 3% лучший результат. Откатили 20 апреля.

Разобрались не сразу. Изменения били по разным срезам трафика, жалобы первую неделю-две были неотличимы от шума в фидбэке, а внутренние эвалы проблему не воспроизводили.

Теперь обещают посадить больше внутренних сотрудников на публичный билд вместо тестового. Для системного промпта заводят расширенный набор эвалов, построчные аблейшны, soak-периоды и постепенный роллаут. Code Review допилят и выложат наружу.
Anthropic An update on recent Claude Code quality reports Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
  • 🔥 7
  • ❤ 1
  • 👍 1
More from @syabro_notes
  1. Sep 25, 2026TLDR AX (Agent eXecutor) - оркестратор песочниц для агентов на базе Kubernetes. Для тех кт…
  2. Sep 25, 2026tldr В Codex добавили общую доску сообщений для сабагентов. 21 сентября смерджили PR #4701…
  3. Sep 22, 2026photo post
  4. Sep 17, 2026типичный AGENTS.md
  5. Sep 17, 2026Если вам говорят что SWE2 заебись - не верьте. Тупое убожество. Сделало 2 разных вариант д…
  6. Sep 14, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →