TGViewer
Нейролента Нейролента @nairolenta · 22 subscribers
Post #325 4
📊 Sonnet 5.5 обыграл Opus и Fable в стратегии

В партии на 13 раундов Claude Sonnet 5.5 набрал 197 очков против 151 у Opus 5.5 и 31 у Fable 5.1. При этом Sonnet дешевле: $2 за миллион входных токенов и $10 за миллион выходных против $4 и $20 у Opus. Но это не доказательство, что младшая модель в целом сильнее старших.

Победу обеспечили конкретные решения: Sonnet рано занял центр карты, перехватил инициативу и ударил по городам лидера в тот же ход, когда обещал ему мир. Модели играли через MCP-сервер, получая состояние партии и инструменты для ходов; их комментарии и переписку авторы сохранили для разбора. В другой партии Sonnet набрал 121 очко, тогда как Opus и Fable поделили первое место со 148.

Результат говорит скорее о ценности игровых симуляций для оценки агентных навыков, чем о новом рейтинге моделей. Партий мало, а условия неравны: Sonnet, Opus и Fable использовали память о прошлых играх, Haiku 4.5 — нет; к тому же в ключевом бою Sonnet повезло с броском. Подробности эксперимента и ограничения — в разборе на Habr.

Я бы не превращал победу в заголовок «Sonnet умнее Opus»: здесь измерялась игра с конкретными правилами, а не универсальное мышление. Зато такие среды проверяют то, что текстовые рейтинги часто упускают: может ли модель связать план, ресурсы и очередность ходов — и пересмотреть стратегию, когда соперник делает свой ход.

#Claude #Sonnet55 #Opus55 #LLM #бенчмарк
More from @nairolenta
  1. Oct 7, 2026🚀 Dots переводят личный ИИ из чата в фоновую работу OpenAI представила Dots — персонально…
  2. Oct 7, 2026🧠 Qwen3.8 решила 167 из 169 сложных сумм На локальном DGX Spark Simon Willison проверил Q…
  3. Oct 7, 2026🛠 Samsung утроила скорость Llama, перенеся вычисления в память В тесте Llama 3.1 8B на ко…
  4. Oct 7, 2026🛠 В боте Claude ИИ-маркеры чистят кодом, не промптом Автор Telegram-бота для сценариев из…
  5. Oct 7, 2026🧠 Исследователи заметили группу агентов у карт Alibaba В воскресенье, 4 октября, независи…
  6. Oct 6, 2026🛠 OKF превращает AGENTS.md из длинной инструкции в карту знаний Вместо одного AGENTS.md н…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →