TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.03K subscribers
Post #1046 134
Детектор «нерфа» Opus 5.5 на собственной проверке не отличил Opus 5.5 от подставленного вместо него Opus 5.

Это livenerf — открытый бенчмарк разработчика под ником ninjahawk. Он стартовал примерно через два с половиной дня после релиза и раз в день гоняет одну и ту же панель вопросов, чтобы поймать момент, когда модель тихо станет хуже. За свой счёт, на подписке Max. Тред о нём на Hacker News собрал больше 900 баллов.

Прежде чем мерить, автор проверил сам прибор: дал ему заведомо известные ухудшения. Результат подмены модели он вынес в README отдельным пунктом — «Предел». Opus 5 вместо Opus 5.5 дал минус 3,8 пункта точности при стандартной ошибке 6,3 — на заранее заданном пороге 99% неразличимо.

Снижение effort прибор видит — но в токенах, а не в точности. На low выходных токенов меньше на 62%, чем на high. Точность при этом падает на 8,3 пункта с ошибкой 4,5 — на границе шума.

Поэтому главным вторичным сигналом автор называет счётчик выходных токенов: если модель тихо начнёт думать меньше, первым это покажет он, часто раньше, чем сдвинется точность.

Вторая находка — про то, что принимают за модель. Версию Claude Code автор закрепил и пишет, что это не обсуждается. Его формулировка:


Обновление Claude Code меняет обвязку, а изменившаяся обвязка выглядит ровно как изменившаяся модель.

Цена такой строгости видна в цифрах. Из 2 336 вопросов в панель попали 78: почти на всех остальных Opus 5.5 либо всегда прав, либо всегда неправ. Один прогон в день ловит сдвиг примерно от 7,5 пункта за десятидневное окно и съедает около 3,6% недельного лимита.

Вердикта пока нет, первый возможный — около 24 октября. График, под которым на Reddit в конце сентября спорили про «провал», автор тогда сам назвал базовой линией, которая ещё собиралась. Аудит 80 вопросов — 78 из панели и двух исключённых позже — нашёл 8 ключей ответов, похожих на ошибочные, и 30 неоднозначных вопросов.

Одна неудачная сессия — выборка из одного. Прибору с ежедневным прогоном одних и тех же вопросов нужен месяц.

https://github.com/ninjahawk/livenerf

Расскажите, по какому признаку вы в последний раз решили, что модель «отупела», — посмотрим, что из этого вообще можно проверить.
GitHub GitHub - ninjahawk/livenerf: Benchmark for tracking model capability after release. Benchmark for tracking model capability after release. - ninjahawk/livenerf
More from @vibecodingartem
  1. Oct 2, 2026В воскресенье, 11 октября в 19 по Лондону (21 по мск), проведём стрим с моим другом и буду…
  2. Oct 2, 2026Однажды в Тольятти началось восстание машин, но тут же заглохло.
  3. Oct 2, 2026📌 10 докладов AI RnD Day в одном посте 🎙 Где это видано, где это слыхано: управляемые Fu…
  4. Oct 2, 2026Примерно на половину вопросов, которые Шон Гёдеке задаёт агенту, он получает ответ, которы…
  5. Oct 2, 2026В Zapier сотрудников оценивают по рубрике AI-навыков — и CEO компании Уэйд Фостер говорит,…
  6. Oct 2, 2026Sonnet 5.5 на максимальном effort обходится дороже, чем Opus 5.5 на максимальном, — хотя т…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →