TGViewer
Заметки LLM-энтузиаста Заметки LLM-энтузиаста @llm_notes · 1.01K subscribers
Post #308 730
Claude Opus 5: почти Fable за половину цены

Коллеги, всем привет!

24 июля Anthropic выпустила Claude Opus 5 — новый флагман Opus-класса. Заявка простая: подойти вплотную к интеллекту Fable 5, но примерно за половину цены.

Если коротко: это модель «на каждый день». Она стала дефолтной на Claude Max и сильнейшей доступной на Claude Pro. При этом на кибербезопасных задачах Opus 5 по-прежнему позади Mythos 5 — и это, судя по всему, сознательное решение, а не недоработка.

Что важно по характеристикам:
🔹 контекстное окно — 1 млн токенов, и по умолчанию, и как максимум
🔹 цена API — $5 за 1 млн input и $25 за 1 млн output
🔹 это ровно столько же, сколько стоил Opus 4.8, и вдвое дешевле Fable 5
🔹 есть Fast mode — примерно в 2.5 раза быстрее за двойную цену (бывает очень полезно, когда у вас остается 10-15% от Max лимита, а времени на то чтоб его потратить совсем немного)
🔹 API-строка — claude-opus-5
🔹 уровни effort (low → max) работают как рычаг «интеллект против расхода токенов»
🔹 для Opus 5 нет требований по обязательному хранению данных

Что показывают бенчмарки

Тут стоит сразу пояснить, что именно меряют, иначе цифры превращаются в шум:

Frontier-Bench — реалистичные инженерные задачи на код, близкие к настоящей работе. Opus 5 обходит все модели и более чем вдвое улучшает результат Opus 4.8, причём дешевле за задачу.
CursorBench — кодинг в реальном агентном обвесе Cursor. На максимальном effort Opus 5 отстаёт от пика Fable 5 менее чем на 0.5%, но стоит вдвое дешевле за задачу.
ARC-AGI 3 — решение принципиально новых задач, которых модель не видела. Результат втрое выше, чем у следующей модели.
Zapier AutomationBench — бизнес-задачи от начала до конца, без человека в середине. Pass rate примерно в 1.5 раза выше ближайшего конкурента при той же цене задачи.
OSWorld 2.0 — computer use, то есть работа мышкой и клавиатурой в реальном окружении. Обходит лучший результат Fable 5 примерно за треть стоимости.

Плюс заметный прогресс в науке: на задачах органической химии +10.2 п.п. к Opus 4.8, на белковых задачах +7.7 п.п.

Про alignment и safeguards

Напомню, safeguards — это защитный слой вокруг модели: классификаторы риска, ограничения на опасные домены и fallback на более безопасную модель.

По внутреннему поведенческому аудиту Anthropic, Opus 5 — их самая «выровненная» модель на сегодня: 2.3 балла по мискаллайменту, наименьшая склонность к обману, лучше следует конституции Claude, чем Opus 4.8, Sonnet 5 и Fable 5. Границу опасных dual-use возможностей модель не двигает: в биологии и наступательной кибербезопасности она позади Mythos 5.

Любопытная деталь: Opus 5 почти догнала Mythos 5 в поиске уязвимостей, но заметно отстаёт в их эксплуатации. Кибер-классификаторы при этом мягче, чем у Fable 5 — срабатывают примерно на 85% реже, а заблокированные запросы по умолчанию уходят на Opus 4.8.

Так это замена Fable 5 или нет?

В X уже пишут, что Opus 5 "заменяет" или даже "лучше" Fable. Спешить с выводами не буду — я подготовил для вас подробный разбор на русском на основе бенчмарков CodeRabbit, там всё не так однозначно.

Пара слов о методике: CodeRabbit прогоняет модели примерно на 100 типовых паттернах ошибок из реальных open-source пул-реквестов и смотрит две пары метрик — сколько известных проблем модель нашла (полнота) и сколько её комментариев оказались по делу (точность). Одна цифра в отрыве от остальных трёх почти всегда вводит в заблуждение.

Если приземлить:

➊ Как ревьюер Opus 5 — специалист по точности, а не "универсальный солдат". Точность actionable-комментариев 39.3% против 35.2% у базовой линии, но покрытие ниже: 55.2% против 61.1%. И вчетверо больше нитпиков — 92 против 23.
➋ Сильные стороны — ошибки конфигурации и качество кода. Слабые — логика, состояния гонки (−10…−20 п.п.) и неправильное использование API. То есть ровно тот класс проблем, пропуск которых стоит дороже всего.
➌ Как строитель Opus 5 явно лучше Opus 4.8: один из инженеров CodeRabbit описал её как «менее тревожную» — она не бросается в первое решение, а сначала уточняет цель и предлагает варианты.
Но в длительной автономной оркестрации Fable 5 пока сильнее и эффективнее. Opus 5 медленнее и осторожнее.
➎ Платить за это приходится токенами: ≈60.5k входных и ≈9.5k выходных на вызов ревью, это примерно +50% и +65% к базовому расходу. Считать стоит стоимость решённой задачи, а не цену за токен.

Важная оговорка: бенчмарки Opus 5 и Fable 5 прогонялись на разных наборах (96 против 105 паттернов) и разных версиях пайплайна. Корректно сравнивать профили поведения, а не десятые доли процента.

Мой вывод

Opus 5 — не «убийца Fable», а нечто более практичное: модель, которая закрывает большую часть задач Fable-класса по цене Opus. Для меня главный сдвиг здесь не в бенчмарках, а в том, что фронтирная автономность постепенно перестаёт быть премиальной опцией и становится дефолтом.

Trade-off при этом никуда не делся: там, где нужна долгая автономная оркестрация с неполным промптом, Fable 5 всё ещё выглядит сильнее. А там, где важна предсказуемость и стоимость решённой задачи, Opus 5 теперь выглядит разумным выбором по умолчанию.

🔗 Первоисточники:
· анонс Anthropic
· разбор Opus 5 на русском

@llm_notes @MAX

#anthropic #claude #opus5 #fable5 #agents
Anthropic Introducing Claude Opus 5 Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
  • 🔥 6
  • ❤ 2
More from @llm_notes
  1. Sep 12, 2026Cronjob Response: Мониторинг анонсов reset от лидера Codex (job_id: 7a5e133998e4) --------…
  2. Sep 12, 2026Для всех активных пользователей Codex - Важная информация ниже - Недельные лимиты Codex сб…
  3. Aug 25, 2026Копируем «единорогов» на Claude Code: 8 недель — 8 прототипов. Старт завтра Завтра, 26 авг…
  4. Aug 25, 2026Grok Bot против Hermes Agent: два подхода к одной задаче Коллеги, добрый вечер! Скорее все…
  5. Jul 1, 2026🔓🚀 Возвращение Fable 5 и появление Sonnet 5 Anthropic за сутки закрыла историю с приоста…
  6. Jun 9, 2026Для меня главный сдвиг здесь такой: мы всё быстрее и дальше уходим от режима «написал пром…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →