TGViewer
Loud | Chaser Arc Loud | Chaser Arc @loudyprime · 98 subscribers
Post #97 161
Claude Opus 4.7 вышел. Разбираем бенчмарки

Anthropic выпустили таблицу сравнения с GPT-5.4, Gemini 3.1 Pro и своим секретным Mythos Preview. Объясняю, что каждый бенчмарк значит на практике


Agentic coding (SWE-Bench): реальные баги из GitHub — модель должна найти и починить код сама

4.6 → 4.7: с 53% до 64% (+11%)
GPT-5.4: 57.7% — позади
Gemini: 54.2% — позади

Claude 4.7 теперь лучший в автономном написании кода

Agentic terminal coding: работа в терминале — команды, скрипты, автоматизация

4.6 → 4.7: с 65% до 69%
GPT-5.4: 75.1% — впереди (но с оговоркой: self-reported)

Multidisciplinary reasoning (Humanity's Last Exam): самый сложный экзамен в мире — вопросы уровня PhD по физике, математике, праву, медицине одновременно

4.6 → 4.7: с 40% до 47% (без инструментов)
С инструментами: 54.7% — лучше всех кроме GPT-5.4

Agentic search (BrowseComp): поиск в интернете с несколькими шагами — найти факт, который нельзя загуглить напрямую

4.7: 79.3%
GPT-5.4: 89.3% — явно впереди
Gemini: 85.9% — впереди

Честно: здесь Claude уступает. Поиск и навигация по сети — слабое место

Scaled tool use (MCP-Atlas): работа с большим количеством MCP-инструментов одновременно

4.6 → 4.7: с 75.8% до 77.3%
GPT-5.4: 68.1% — позади
Gemini: 73.9% — позади

Вывод: лучший в работе с инструментами

Agentic computer use: управление компьютером — клики, интерфейсы, приложения.

4.6 → 4.7: с 72.7% до 78.0% (+5.3%)
GPT-5.4: 75.0% — позади
Mythos Preview: 79.6% — чуть впереди

Agentic financial analysis: финансовый анализ через агентов — данные, отчёты, решения

4.6 → 4.7: с 60.1% до 64.4%
GPT-5.4: 61.5% — позади
Лучший результат среди всех публичных моделей

Cybersecurity (CyberGym): воспроизведение реальных уязвимостей — то самое что Claude Mythos нашёл в OpenBSD

4.7: 73.1% — примерно как 4.6 (73.8%)
GPT-5.4: 66.3% — позади
Mythos Preview: 83.1% — далеко впереди

Graduate-level reasoning (GPQA Diamond): вопросы уровня PhD по науке

4.7: 94.2%
GPT-5.4: 94.4% — почти вровень
Gemini: 94.3% — почти вровень

Все топ-модели сошлись в ~94%

Visual reasoning (CharXiv): понимание графиков, диаграмм, научных визуализаций

4.6 → 4.7: с 69.1% до 82.1% (+13% — самый большой прирост)
С инструментами: 91.0%

Самый заметный прогресс в этом релизе

Что в итоге:

Claude Opus 4.7 лучший в автономном написании кода, сделал самый большой прыжок в распознавании графиков и диаграмм (+13%), лидер по работе с инструментами, лучший в финансовом анализе. Но в поиске и работе с терминалом — GPT-5.4 впереди

В правом столбце — Mythos Preview. Он лучше по всем метрикам. Его вряд ли выпустят публично

Теперь наконец-то этот Claude Code стал умнее 😎
More from @loudyprime
  1. Jun 14, 2026Comeback Is Real? В конце марта я почти перестал вести свой Твиттер. Вокруг было слишком м…
  2. May 25, 2026Composer 2.5 и DeepSeek V4: конкуренты Claude и GPT? Раньше дорогие модели было проще опра…
  3. May 23, 2026100. Cпасибо всем, кто читает канал. Для кого-то 100 подписчиков — вообще ни о чем. Для ме…
  4. May 20, 2026Превращаем кладбище заметок в Избранном в рабочую систему Знакома ситуация? Нашел полезный…
  5. May 14, 2026Кстати, вот один из примеров, как мне отвечает мой агент. Смог настроить его так, как и хо…
  6. May 14, 2026Почему тебе стоит персонализировать своего ИИ-агента Я заметил, что люди обычно делятся на…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →