Коллеги, всем привет!
24 июля Anthropic выпустила Claude Opus 5 — новый флагман Opus-класса. Заявка простая: подойти вплотную к интеллекту Fable 5, но примерно за половину цены.
Если коротко: это модель «на каждый день». Она стала дефолтной на Claude Max и сильнейшей доступной на Claude Pro. При этом на кибербезопасных задачах Opus 5 по-прежнему позади Mythos 5 — и это, судя по всему, сознательное решение, а не недоработка.
Что важно по характеристикам:
🔹 контекстное окно — 1 млн токенов, и по умолчанию, и как максимум
🔹 цена API — $5 за 1 млн input и $25 за 1 млн output
🔹 это ровно столько же, сколько стоил Opus 4.8, и вдвое дешевле Fable 5
🔹 есть Fast mode — примерно в 2.5 раза быстрее за двойную цену (бывает очень полезно, когда у вас остается 10-15% от Max лимита, а времени на то чтоб его потратить совсем немного)
🔹 API-строка —
claude-opus-5🔹 уровни effort (low → max) работают как рычаг «интеллект против расхода токенов»
🔹 для Opus 5 нет требований по обязательному хранению данных
Что показывают бенчмарки
Тут стоит сразу пояснить, что именно меряют, иначе цифры превращаются в шум:
➊ Frontier-Bench — реалистичные инженерные задачи на код, близкие к настоящей работе. Opus 5 обходит все модели и более чем вдвое улучшает результат Opus 4.8, причём дешевле за задачу.
➋ CursorBench — кодинг в реальном агентном обвесе Cursor. На максимальном effort Opus 5 отстаёт от пика Fable 5 менее чем на 0.5%, но стоит вдвое дешевле за задачу.
➌ ARC-AGI 3 — решение принципиально новых задач, которых модель не видела. Результат втрое выше, чем у следующей модели.
➍ Zapier AutomationBench — бизнес-задачи от начала до конца, без человека в середине. Pass rate примерно в 1.5 раза выше ближайшего конкурента при той же цене задачи.
➎ OSWorld 2.0 — computer use, то есть работа мышкой и клавиатурой в реальном окружении. Обходит лучший результат Fable 5 примерно за треть стоимости.
Плюс заметный прогресс в науке: на задачах органической химии +10.2 п.п. к Opus 4.8, на белковых задачах +7.7 п.п.
Про alignment и safeguards
Напомню, safeguards — это защитный слой вокруг модели: классификаторы риска, ограничения на опасные домены и fallback на более безопасную модель.
По внутреннему поведенческому аудиту Anthropic, Opus 5 — их самая «выровненная» модель на сегодня: 2.3 балла по мискаллайменту, наименьшая склонность к обману, лучше следует конституции Claude, чем Opus 4.8, Sonnet 5 и Fable 5. Границу опасных dual-use возможностей модель не двигает: в биологии и наступательной кибербезопасности она позади Mythos 5.
Любопытная деталь: Opus 5 почти догнала Mythos 5 в поиске уязвимостей, но заметно отстаёт в их эксплуатации. Кибер-классификаторы при этом мягче, чем у Fable 5 — срабатывают примерно на 85% реже, а заблокированные запросы по умолчанию уходят на Opus 4.8.
Так это замена Fable 5 или нет?
В X уже пишут, что Opus 5 "заменяет" или даже "лучше" Fable. Спешить с выводами не буду — я подготовил для вас подробный разбор на русском на основе бенчмарков CodeRabbit, там всё не так однозначно.
Пара слов о методике: CodeRabbit прогоняет модели примерно на 100 типовых паттернах ошибок из реальных open-source пул-реквестов и смотрит две пары метрик — сколько известных проблем модель нашла (полнота) и сколько её комментариев оказались по делу (точность). Одна цифра в отрыве от остальных трёх почти всегда вводит в заблуждение.
Если приземлить:
➊ Как ревьюер Opus 5 — специалист по точности, а не "универсальный солдат". Точность actionable-комментариев 39.3% против 35.2% у базовой линии, но покрытие ниже: 55.2% против 61.1%. И вчетверо больше нитпиков — 92 против 23.
➋ Сильные стороны — ошибки конфигурации и качество кода. Слабые — логика, состояния гонки (−10…−20 п.п.) и неправильное использование API. То есть ровно тот класс проблем, пропуск которых стоит дороже всего.
➌ Как строитель Opus 5 явно лучше Opus 4.8: один из инженеров CodeRabbit описал её как «менее тревожную» — она не бросается в первое решение, а сначала уточняет цель и предлагает варианты.
➍ Но в длительной автономной оркестрации Fable 5 пока сильнее и эффективнее. Opus 5 медленнее и осторожнее.
➎ Платить за это приходится токенами: ≈60.5k входных и ≈9.5k выходных на вызов ревью, это примерно +50% и +65% к базовому расходу. Считать стоит стоимость решённой задачи, а не цену за токен.
Важная оговорка: бенчмарки Opus 5 и Fable 5 прогонялись на разных наборах (96 против 105 паттернов) и разных версиях пайплайна. Корректно сравнивать профили поведения, а не десятые доли процента.
Мой вывод
Opus 5 — не «убийца Fable», а нечто более практичное: модель, которая закрывает большую часть задач Fable-класса по цене Opus. Для меня главный сдвиг здесь не в бенчмарках, а в том, что фронтирная автономность постепенно перестаёт быть премиальной опцией и становится дефолтом.
Trade-off при этом никуда не делся: там, где нужна долгая автономная оркестрация с неполным промптом, Fable 5 всё ещё выглядит сильнее. А там, где важна предсказуемость и стоимость решённой задачи, Opus 5 теперь выглядит разумным выбором по умолчанию.
🔗 Первоисточники:
· анонс Anthropic
· разбор Opus 5 на русском
@llm_notes @MAX
#anthropic #claude #opus5 #fable5 #agents