У Claude Opus 5.5 результат в NerfBench снизился: с 103,8% вчера до 94,2% сегодня. BridgeMind отметила, что пока это вписывается в обычные колебания и говорить о нерфе преждевременно.
Бенчмарк оценивает, как меняется модель после релиза. За 100% берут её исходный результат, после чего тесты повторяют и сравнивают с ним. В итоговом индексе учитываются качество решения задач, расход токенов и стоимость. Авторы пояснили, что показатель может упасть даже при том же качестве ответов, если модель начинает тратить больше токенов или денег. Проценты здесь считаются относительно собственного старта каждой модели, поэтому по ним нельзя сравнивать интеллект Opus и Sol.
Авторы считают диапазон 90–110% нормальным разбросом. При этом задания, веса и метод определения ухудшений не раскрыты, поэтому независимо повторить их выводы по опубликованной методике не получится.
INCUBE.AI | ПОДПИСАТЬСЯ
Post #3457
1.01K

- ❤ 5