☝🏻За Claude установили слежку: проверяют, глупеет ли он после релиза
Разработчик под ником ninjahawk запустил livenerf — открытый бенчмарк, который отвечает на один вопрос: становится ли модель тихо хуже после выхода.
Пользователи месяцами жалуются, что Anthropic «нерфит» модели через несколько дней или недель после релиза.
Чистой точки отсчёта ни у кого не было, поэтому спор сводился к «ощущения против ощущений».🤷🏼♀️
Claude Opus 5.5 вышел 22 сентября, замеры стартовали 24-го.
Как это устроено:
🔻 из 2336 задач (GPQA Diamond, MMLU-Pro, олимпиадная математика) отобрали 78 — те, на которых модель отвечает верно лишь иногда
🔻 панель прогоняют раз в день в течение 30 дней, первые 10 дней — эталон
🔻 промпты заморожены, версия Claude Code зафиксирована, ответы сверяются точным совпадением — без ИИ-судьи
🔻 параллельно идёт контрольная Opus 5: если просели обе модели, изменилась платформа, а не Opus 5.5
☝🏻Главный побочный сигнал — число выходных токенов: если модель начнёт «думать меньше», это видно раньше, чем упадёт точность.
Работает всё на Inspect — открытом фреймворке британского института безопасности ИИ, через обычную подписку Max, без API-ключа.
Пока собрано 6 дней из 30, первый вердикт — примерно 24 октября.
Автор обещает показывать улучшения так же громко, как ухудшения. Через месяц у спора про «нерф» впервые появятся цифры вместо ощущений.📊
================
У этого канала есть YouTube👁
Post #9569
4.16K

- 🤔 35
- 👍 34
- ❤ 6
- 🔥 4