TGViewer
INCUBE.AI | Нейросети и не только INCUBE.AI | Нейросети и не только @incubeai_pro · 14.7K subscribers
Post #3457 1.01K
У Claude Opus 5.5 результат в NerfBench снизился: с 103,8% вчера до 94,2% сегодня. BridgeMind отметила, что пока это вписывается в обычные колебания и говорить о нерфе преждевременно.

Бенчмарк оценивает, как меняется модель после релиза. За 100% берут её исходный результат, после чего тесты повторяют и сравнивают с ним. В итоговом индексе учитываются качество решения задач, расход токенов и стоимость. Авторы пояснили, что показатель может упасть даже при том же качестве ответов, если модель начинает тратить больше токенов или денег. Проценты здесь считаются относительно собственного старта каждой модели, поэтому по ним нельзя сравнивать интеллект Opus и Sol.

Авторы считают диапазон 90–110% нормальным разбросом. При этом задания, веса и метод определения ухудшений не раскрыты, поэтому независимо повторить их выводы по опубликованной методике не получится.

INCUBE.AI | ПОДПИСАТЬСЯ
  • ❤ 5
More from @incubeai_pro
  1. Oct 11, 2026Обучаем свою ИИ-модель для принятия решений — в сети появился бесплатный практический гайд…
  2. Oct 10, 2026Фотошоп можно выбросить: появился локальный редактор, который умеет полностью менять освещ…
  3. Oct 10, 2026Трюк Карпаты сработал: локальная LLM на Mac M5 выдает 117 токенов в секунду Как open-sourc…
  4. Oct 10, 2026Забираем самую полезную тулзу для подготовки отчётов и технических доков к поиску, аналити…
  5. Oct 10, 2026Microsoft показала Decision-1 — новую ИИ-модель для принятия решений, которая опережает Je…
  6. Oct 10, 2026Делаем рекламу собственного проекта Brag — инструмент для создания промо-ролика вашего про…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →