🤝 Claude Opus 5: что показывают цифры
Anthropic выпустила Opus 5 по цене Opus 4.8: $5 за миллион входных и $25 за миллион выходных токенов. В API — контекст до 1 млн токенов и генерация до 128 тысяч. Это вдвое дешевле Fable 5.
Ключевые результаты:
— Frontier-Bench: 43,3% против 34,4% у GPT-5.6 Sol
— GDPval-AA: 1861, лучший результат
— ARC-AGI-3: 30,2% против 7,8% у GPT
— BrowseComp: 90,8%
— OSWorld 2.0: 70,6%
— AutomationBench: 26% против 18,1% у GPT
— Humanity’s Last Exam с инструментами: 64,7%
Но полного лидерства нет. На DeepSWE впереди GPT-5.6 Sol: 72,7% против 68,8%. На FrontierCode и юридическом тесте Opus уступает Fable.
Важно: это данные Anthropic, а не независимая сводка. Frontier-Bench запускался внутри компании, результаты усреднялись по пяти попыткам, а при некоторых защитных отказах использовался Opus 4.8 как fallback.
Вывод: Opus 5 не лучшая модель во всех тестах, но её результаты близки к Fable при половинной цене. Главный прогресс — в агентном программировании и управлении компьютером.
Post #1908
3.91K

- ❤ 17
- 👍 2
- 👎 2
- 🔥 2
- 😁 1