Anthropic выпустили таблицу сравнения с GPT-5.4, Gemini 3.1 Pro и своим секретным Mythos Preview. Объясняю, что каждый бенчмарк значит на практике
✨ Agentic coding (SWE-Bench): реальные баги из GitHub — модель должна найти и починить код сама
4.6 → 4.7: с 53% до 64% (+11%)
GPT-5.4: 57.7% — позади
Gemini: 54.2% — позади
Claude 4.7 теперь лучший в автономном написании кода
✨ Agentic terminal coding: работа в терминале — команды, скрипты, автоматизация
4.6 → 4.7: с 65% до 69%
GPT-5.4: 75.1% — впереди (но с оговоркой: self-reported)
✨ Multidisciplinary reasoning (Humanity's Last Exam): самый сложный экзамен в мире — вопросы уровня PhD по физике, математике, праву, медицине одновременно
4.6 → 4.7: с 40% до 47% (без инструментов)
С инструментами: 54.7% — лучше всех кроме GPT-5.4
✨ Agentic search (BrowseComp): поиск в интернете с несколькими шагами — найти факт, который нельзя загуглить напрямую
4.7: 79.3%
GPT-5.4: 89.3% — явно впереди
Gemini: 85.9% — впереди
Честно: здесь Claude уступает. Поиск и навигация по сети — слабое место
✨ Scaled tool use (MCP-Atlas): работа с большим количеством MCP-инструментов одновременно
4.6 → 4.7: с 75.8% до 77.3%
GPT-5.4: 68.1% — позади
Gemini: 73.9% — позади
Вывод: лучший в работе с инструментами
✨ Agentic computer use: управление компьютером — клики, интерфейсы, приложения.
4.6 → 4.7: с 72.7% до 78.0% (+5.3%)
GPT-5.4: 75.0% — позади
Mythos Preview: 79.6% — чуть впереди
✨ Agentic financial analysis: финансовый анализ через агентов — данные, отчёты, решения
4.6 → 4.7: с 60.1% до 64.4%
GPT-5.4: 61.5% — позади
Лучший результат среди всех публичных моделей
✨ Cybersecurity (CyberGym): воспроизведение реальных уязвимостей — то самое что Claude Mythos нашёл в OpenBSD
4.7: 73.1% — примерно как 4.6 (73.8%)
GPT-5.4: 66.3% — позади
Mythos Preview: 83.1% — далеко впереди
✨ Graduate-level reasoning (GPQA Diamond): вопросы уровня PhD по науке
4.7: 94.2%
GPT-5.4: 94.4% — почти вровень
Gemini: 94.3% — почти вровень
Все топ-модели сошлись в ~94%
✨ Visual reasoning (CharXiv): понимание графиков, диаграмм, научных визуализаций
4.6 → 4.7: с 69.1% до 82.1% (+13% — самый большой прирост)
С инструментами: 91.0%
Самый заметный прогресс в этом релизе
Что в итоге:
Claude Opus 4.7 лучший в автономном написании кода, сделал самый большой прыжок в распознавании графиков и диаграмм (+13%), лидер по работе с инструментами, лучший в финансовом анализе. Но в поиске и работе с терминалом — GPT-5.4 впереди
В правом столбце — Mythos Preview. Он лучше по всем метрикам. Его вряд ли выпустят публично
Теперь наконец-то этот Claude Code стал умнее 😎
