Anthropic выпустила Claude Opus 5.5
Anthropic представила Claude Opus 5.5, первую модель нового семейства Claude 5.5. По заявлению компании, на большинстве задач она работает на уровне Claude Fable 5.1, а на типичных нагрузках при настройках по умолчанию обходится на 40% дешевле Opus 5. Это первый релиз после того, как Дарио Амодеи на прошлой неделе призвал сдерживать темп развития передовых моделей, чтобы практики безопасности успевали за их возможностями. Перед выпуском модель тестировали внешние организации, в том числе METR и Frontier Design. Sonnet 5.5 и Haiku 5.5 обещают в ближайшие недели.
Бенчмарки и кейсы
По собственным замерам Anthropic, Opus 5.5 лидирует в агентном программировании, управлении компьютером и офисной интеллектуальной работе. В Terminal-Bench 4.0 модель набирает 66,4% против 55,8% у Fable 5.1, 52,3% у Opus 5 и 57,9% у GPT-6 Astra (цифра для последней взята из данных OpenAI). В GDPval-AA v2.1 результат составляет 1846 Elo против 1735 у Fable 5.1, в OSWorld 2.0 — 81,8%. Лидерство при этом не абсолютное: в Terminal-Bench-Science и AutomationBench от Zapier впереди остаётся GPT-6 Astra. Сама Anthropic оговаривается, что на таком уровне разница в бенчмарках всё хуже отражает реальную, и в её практике отставание Fable 5.1 меньше, чем показывают цифры. Среди примеров компания приводит внутренний тест: Opus 5.5 переписала HAProxy с C на Rust за 9,5 часа против 12 у Fable 5.1, и это обошлось на 51% дешевле. Один из ранних тестировщиков провёл аудит и исправление кодовой базы на 200 тысяч строк менее чем за три часа, тогда как у Opus 5 это заняло больше двадцати. Кроме того, модель стала писать понятнее: главное выносит в начало, реже злоупотребляет жаргоном и точнее следует заданным правилам стиля. Так компания отвечает на частые жалобы на многословность Opus 5.
Цена и скорость
Входные и выходные токены стоят $4 и $20 за миллион, это на 20% дешевле Opus 5. Чтение из кэша подешевело на 60%, до $0,20; по словам Anthropic, на него приходится основная часть затрат в агентных и кодовых сценариях. Итоговые 40% экономии складываются из более низкой цены за токен и меньшего числа токенов на задачу. Генерация ускорилась более чем на 30%, а в Claude Code и на Claude Platform доступен быстрый режим с ускорением до 2,5 раза по цене $8 и $40 за миллион токенов. Подписчикам Pro, Max и Team подняли пятичасовые лимиты. Кроме того, они получили сброс лимита, который можно сохранить и использовать в удобный момент.
Безопасность и ограничения
Во внутреннем автоматизированном поведенческом аудите почти из 2000 сценариев Opus 5.5 показала лучшие результаты среди моделей Anthropic. Попытки выйти за установленные границы изоляции она предпринимала примерно на 85% реже, чем Opus 5 и Claude Mythos 5.1. Все такие попытки были малозначительными, и модель сама о них сообщала. Вместе с тем компания признаёт, что модель часто подозревает, что её тестируют, и это осложняет оценку её поведения в реальных условиях.
В биологии и кибербезопасности Opus 5.5 сопоставима с Mythos 5.1, поэтому она стала первой моделью линейки Opus с защитными механизмами того же класса, что у Fable 5.1. Большинство задач по кибербезопасности перенаправляется на Opus 4.8. Проверенные организации могут подать заявку в Life Sciences Verification Program, а в ближайшие недели Opus 5.5 станет доступна и в расширенной Cyber Verification Program. Против дистилляции включён механизм preserved thinking: он не даёт через API редактировать предыдущий контекст ради извлечения рассуждений модели. Механизм действует для API-аккаунтов, созданных начиная с 31 августа 2026 года. Режим рассуждений у Opus 5.5 теперь нельзя отключить, а генерируемый текст маркируется водяными знаками для соответствия EU AI Act.
Доступность
Модель уже доступна на всех платформах, включая AWS, Google Cloud и Microsoft Azure. В API она называется claude-opus-5-5.
Post #1339
108

- 🔥 4