Итак, Claude Fable 5.1 продержалась на посту флагмана Anthropic всего три недели – вышедший сегодня Opus 5.5 обходит ее почти во всех бенчмарках и выглядит сильным соперником для GPT-6 Astra. Особенно впечатляюще смотрится скачок в индексе Artificial Analysis: с 53 баллов у GPT-6 и Fable 5.1 до 58 баллов у Opus 5.5.
Подробный разбор бенчмарков я в этот раз вынес на картинку (ее рисовал уже Opus 5.5), в тексте отмечу только самое важное. Главный отрыв – в офисной работе: документы, таблицы, презентации. Здесь рейтинг ставит Opus 5.5 далеко впереди и Fable 5.1, и GPT-6. В программировании картина скромнее: по данным Anthropic модель уходит в отрыв, но в независимом замере идет с GPT-6 вровень. А в научных задачах и автоматизации бизнес-процессов GPT-6 пока впереди.
При этом Opus 5.5 стоит $4 за миллион токенов на входе и $20 на выходе – на 20% дешевле Opus 5 и в 2,5 раза дешевле Fable 5.1 и GPT-6.
У индекса Artificial Analysis есть проблема – в текущей версии он состоит из бенчмарков, которые замеряют умение отвечать на вопросы, работать с документами и в терминале, а задачи, связанные, например, с компьютерным зрением, в него не входят. Этим, кстати, отчасти объясняется паритет GPT-6 с Fable 5.1.
Впрочем, с компьютерным зрением у Opus 5.5 тоже все отлично – именно здесь у модели самый резкий скачок. На редких профессиональных графиках – биржевых свечах, потоковых диаграммах, розах ветров – Opus 5.5 без вспомогательных инструментов решает 64% задач, против 30% у Opus 5 и 45% у Fable 5.1. Даже в самом дешевом режиме, за пару центов за задачу, модель читает графики точнее, чем Fable на любых настройках. Anthropic приводит и бытовые примеры: модель теперь понимает, какие блоки соединяет стрелка на схеме и во сколько начинается встреча на скриншоте календаря.
По снимкам детали Opus 5.5 пишет код ее 3D-модели и здесь сравнялся с GPT-6, у которой пространственное мышление было главным козырем. А за компьютером, работая по скриншотам, доводит до конца почти половину задач – 49% против 37% у Opus 5.
Для подписчиков Anthropic подняла пятичасовые лимиты на Pro, Max и Team, также подарила один ручной сброс лимитов – его надо использовать до 22 октября. Меня же радует, что на планах Max на новинку можно тратить все 100% недельного лимита, в отличие от 50% на Fable 5.1. С учетом того, что по бенчмаркам не видно ни одного кейса, где Fable 5.1 лучше Opus 5.5, получается, что подписка Max разом стала в два раза эффективнее.
На максимальных настройках Opus 5.5 думает заметно дольше предшественника и тратит в 1,6 раза больше токенов – в итоге задача обходится примерно в те же деньги, что и у Opus 5, и лимит сгорает так же быстро.
По замерам Artificial Analysis, выгода начинается на ступеньку ниже: на уровне high новая модель показывает результат Fable 5.1 на максимуме примерно за четверть цены. Недаром по умолчанию Anthropic ставит пользователям medium, а в руководстве советует сначала опробовать модель на этом уровне, повышая лимит рассуждений только тогда, когда недовольны результатом.
Opus 5.5 – первый релиз Anthropic после того, как Дарио Амодеи призвал замедлить гонку передовых моделей. Вышла модель дешевле, быстрее и с большими лимитами, а в ее системной карточке приводится оценка: ИИ уже ускоряет разработку новых моделей примерно в полтора раза.
При этом по безопасности Opus 5.5 – лучшая модель компании. В автоматическом аудите она обошла все недавние Claude почти по всем видам нежелательного поведения и оказалась самой честной. Попыток выйти за пределы «песочницы» у нее на 85% меньше, чем у Opus 5 и Mythos 5.1, а перед рискованным действием она чаще спрашивает разрешения у пользователя.
В общем, анонсом я доволен. Anthropic уже пообещала выпустить Sonnet 5.5 и Haiku 5.5, плюс что-то надо делать с Fable – при нынешнем темпе это “странный флагман на три недели”.
—
Своим опытом работы с ИИ я делюсь в подписке. Недавно там вышел лонгрид, как выжимать максимум из GPT-6 и Fable 5.1 – изложенные в нем базовые правила подойдут и для Opus 5.5.
— Читать на “Бусти”
— Читать на Sponsr


