Anthropic теперь точно замедлится
Через неделю после резонансного эссе Дарио Амодеи о том, что прогресс ИИ нужно сдерживать, чтобы меры безопасности успевали за возможностями моделей, Anthropic выпустила Claude Opus 5.5.
В анонсе модель названа новым фронтиром. Индекс Artificial Analysis это подтверждает. На максимальном уровне рассуждений у нее 58 баллов индекса, у GPT-6 Astra и Claude Fable 5.1 по 53, у Opus 5 было 51. Лучшая открытая модель рейтинга, Xiaomi MiMo-V2.6-Pro, набирает 46.
Opus 5.5 лидирует в шести из десяти тестов индекса, в том числе в Humanity's Last Exam (61,4%) и SciCode (66,9%). На Terminal-Bench 4.0 и AutomationBench-AA она вышла на уровень Astra.
Цена за миллион токенов снизилась с $5/$25 до $4/$20, чтение кеша подешевело с $0,50 до $0,20. Anthropic обещает, что за счет экономии токенов типичная нагрузка обойдется на 40% дешевле. Правда теперь Opus 5.5 тратит около 119 тысяч выходных токенов на задачу у AA против 73 тысяч у Opus 5 и 27 тысяч у GPT-6 Astra. В итоге стоимость задачи осталась на уровне Opus 5.
По биологии и кибербезопасности Opus 5.5 сопоставима с закрытой Claude Mythos 5.1, поэтому получила гардрейлы как у Fable 5.1. Большинство задач по кибербезу Opus 5.5 перенаправляет на 4.8, полный доступ открывается только через программу верификации. Отключить режим рассуждений больше нельзя. Для новых API-аккаунтов действует защита от дистилляции, в ответы встроены водяные знаки.
В собственном поведенческом аудите Anthropic пишет, что попытки выйти за установленные границы случались на 85% реже, чем у Opus 5. Но есть нюанс, Opus 5.5 гораздо чаще понимает, что её тестируют.
@anti_agi
Post #2131
807

- 😁 10
- 🔥 6
- 👍 2
- 🌚 1