TGViewer
Data Secrets Data Secrets @data_secrets · 94.4K subscribers
Post #10088 7.42K
BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза

Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».

Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.

Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.

Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.

Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench

BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
  • 🔥 108
  • ❤ 30
  • 😁 15
  • 👍 8
  • 👏 4
  • 🕊 1
  • 💯 1
  • 😎 1
More from @data_secrets
  1. Oct 2, 2026Yandex B2B Tech добавила гибридный поиск: теперь полнотекстовый и векторный индексы можно…
  2. Oct 2, 2026Ученый из Гарварда придумал, как искать задачи специально под ИИ Мэтью Шварц, который ране…
  3. Oct 2, 2026OpenAI уволили трех рисерчеров из отдела safety: они поделились конфиденциальной информаци…
  4. Oct 2, 2026arXiv ввел лимит на публикацию статей С 1 октября пользователь сможет отправить на arXiv н…
  5. Oct 2, 2026Как проходит тихая революция в рекомендательных системах Рекомендательные системы последни…
  6. Oct 2, 2026Карпаты рассказал, как теперь правильно общаться с LLM Совсем недавно переживали, что Андр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →