🚀 Anthropic выкатила Claude Opus 5
Вышел сегодня, 24 июля. Главный посыл компании: «почти интеллект Fable 5 за половину цены».
Цена та же, что у Opus 4.8 — $5 за миллион входящих токенов и $25 за исходящие.
➖➖➖➖➖➖➖➖➖➖
📊 Что по цифрам
├ Frontier-Bench v0.1 — больше чем удвоил результат Opus 4.8, при этом задача стоит дешевле
├ CursorBench 3.2 — на максимальном усилии отстаёт от Fable 5 на 0,5%, но вдвое дешевле за задачу
├ ARC-AGI 3 (задачи, которых модель раньше не видела) — в три раза выше ближайшего конкурента
├ OSWorld 2.0 (управление компьютером) — обогнал лучший результат Fable 5, потратив примерно треть бюджета
└ Zapier AutomationBench — проходимость бизнес-задач примерно в 1,5 раза выше ближайшей модели при той же цене
➖➖➖➖➖➖➖➖➖➖
🧱 А теперь то, что лично меня зацепило: фильтры
Кто пробовал Fable 5 на технических темах — знает эту боль. Половина вопросов упиралась в «извините, не могу помочь».
Что изменилось:
├ у Opus 5 кибер-классификаторы срабатывают, по оценке Anthropic, примерно на 85% реже, чем у Fable 5
├ поиск уязвимостей в исходном коде — разрешён
└ сканирование бинарников, пентест и написание эксплойтов — по-прежнему заблокировано
➖➖➖➖➖➖➖➖➖➖
🎯 Кому что
По кибербезопасности и биологии Opus 5 официально слабее Mythos 5 — это сделано намеренно, на кибер-задачах модель специально не тренировали.
Забавная деталь из анонса: Anthropic называет Opus 5 самой «выровненной» моделью за всю историю — по внутреннему аудиту поведения она реже других врёт и хуже поддаётся на попытки её обмануть.
Пойду пытать нового помощника.
📲 [Ленивый программист]
📊 [топВышка]
Post #850
1.93K

- 🔥 3
- ❤ 2