BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза
Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».
Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.
Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.
Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.
Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench
BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.
Post #10088
7.42K
- 🔥 108
- ❤ 30
- 😁 15
- 👍 8
- 👏 4
- 🕊 1
- 💯 1
- 😎 1