📊 Sonnet 5.5 обыграл Opus и Fable в стратегии
В партии на 13 раундов Claude Sonnet 5.5 набрал 197 очков против 151 у Opus 5.5 и 31 у Fable 5.1. При этом Sonnet дешевле: $2 за миллион входных токенов и $10 за миллион выходных против $4 и $20 у Opus. Но это не доказательство, что младшая модель в целом сильнее старших.
Победу обеспечили конкретные решения: Sonnet рано занял центр карты, перехватил инициативу и ударил по городам лидера в тот же ход, когда обещал ему мир. Модели играли через MCP-сервер, получая состояние партии и инструменты для ходов; их комментарии и переписку авторы сохранили для разбора. В другой партии Sonnet набрал 121 очко, тогда как Opus и Fable поделили первое место со 148.
Результат говорит скорее о ценности игровых симуляций для оценки агентных навыков, чем о новом рейтинге моделей. Партий мало, а условия неравны: Sonnet, Opus и Fable использовали память о прошлых играх, Haiku 4.5 — нет; к тому же в ключевом бою Sonnet повезло с броском. Подробности эксперимента и ограничения — в разборе на Habr.
Я бы не превращал победу в заголовок «Sonnet умнее Opus»: здесь измерялась игра с конкретными правилами, а не универсальное мышление. Зато такие среды проверяют то, что текстовые рейтинги часто упускают: может ли модель связать план, ресурсы и очередность ходов — и пересмотреть стратегию, когда соперник делает свой ход.
#Claude #Sonnet55 #Opus55 #LLM #бенчмарк
Post #325
4