TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2199 388
🧠 ИИ может неожиданно "поглупеть". Как за этим следить?

Есть часто повторяемая в кругах разработчиков история, когда говорят: «модель раньше работала отлично, а теперь деградировала». Обычно это списывают на эффект привыкания или повышенные ожидания. Но иногда интуиция не обманывает.

Кейс AMD и Claude Code

В начале апреля Стелла Лоренцо, старший директор AI-группы в AMD, опубликовала анализ 6 852 сессий с Claude Code, 17 871 блока рассуждений и 234 760 вызовов инструментов. Вывод был неприятным: «Теперь Claude нельзя доверять выполнение сложных инженерных задач».

Что конкретно изменилось с февраля по март 2026?

1️⃣ Глубина чтений файлов упала с условных 6,6 до 2 условных единиц, например, блоков текста по 100 страниц: модель перестала вдумчиво изучать контекст, который ей предложил пользователь.
2️⃣ Скрипт завершения, отслеживающий «уклонение от задач», до 8 марта не срабатывал ни разу, а после этой даты стал срабатывать в среднем 10 раз в день.
3️⃣ Доля промптов с негативной эмоциональной окраской выросла с 5,8% до 9,8% — это косвенный маркер пользовательской фрустрации.

Команда Лоренцо в итоге переключилась на другого провайдера.

Что ответил Anthropic?

Компания признала два изменения: введение механизма «адаптивного мышления» 9 февраля и понижение дефолтного уровня с «high» до «medium» 3 марта. Их рекомендация — вручную выставить максимальный уровень обратно.

Критики саркастично заметили: это как выпустить апдейт, снизивший мощность двигателя, а потом советовать «просто жать педаль сильнее».


Это не новая история

Самый громкий предыдущий инцидент в августе–сентябре 2025 года завершился тем, что Anthropic опубликовал пост, подтвердивший три инфраструктурных бага, затронувших до 16% запросов Sonnet 4.

А ещё раньше, в 2023-м, исследователи из Stanford и UC Berkeley обнаружили, что GPT-4 решал задачу определения простых чисел с точностью 97,6%, а GPT-4 — с точностью 2,4%. OpenAI тогда ответил примерно так же, как Anthropic сейчас: «мы не делаем модель глупее, это вам кажется».

Почему это важно для бизнеса?

У Лоренцо было 6 852 сессий данных, чтобы доказать деградацию. У большинства команд — ноль. Мы замечаем, что инструмент «как-то не так работает», начинаем переделывать промпт и виним себя за недостаточную точность. Но у нас нет телеметрии, чтобы точно увидеть что происходит

Вот в чём реальный риск внешнего AI-провайдера: качество может молча деградировать, и вы не узнаете об этом, пока кто-то не потратит недели на сбор логов. Модели обновляются непрозрачно, дефолтные настройки меняются без уведомления, а «один и тот же» продукт в марте и в июне может быть совсем разным.

Вы начинаете доверять определённому поведению, а потом оно меняется — и ваше приложение, построенное поверх, начинает давать сбои.

Вывод простой: если вы строите рабочие процессы на AI-инструментах — вам нужна собственная система мониторинга качества. Не «ощущения», а метрики. Иначе вы узнаете о деградации последними.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • 🔥 3
  • ❤ 2
  • 👍 1
More from @testuring
  1. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  2. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  3. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  4. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  5. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  6. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →