Anthropic випустила Claude Opus 5
Anthropic представила Claude Opus 5 — модель, яка змінює логіку вибору між тірами. Основна теза анонсу: інтелект, близький до флагманського Fable 5, за половину вартості.
Ціна і доступ
5 доларів за млн вхідних токенів і 25 доларів за млн вихідних — так само, як в Opus 4.8. Тобто приріст якості не коштує нічого додатково. Доступна на всіх платформах, ідентифікатор в API — claude-opus-5. Є Fast mode зі швидкістю приблизно у 2.5 раза вищою за подвійну ціну. Модель стала дефолтною на Claude Max і найсильнішою на Claude Pro.
Що важливо для агентних систем
Два оновлення в беті мають більше практичного значення, ніж бенчмарки. Перше — зміна доступного набору інструментів усередині розмови без інвалідації prompt cache. Для мультиагентних пайплайнів зі змінним скоупом MCP це прямо впливає на вартість. Друге — автоматичні fallback-и на API: запит, позначений класифікатором безпеки, тепер маршрутизується на іншу модель, а не блокується.
Окремо наголошується на самоверифікації. У прикладах Anthropic модель, не маючи доступу до перегляду креслення, написала власний computer vision пайплайн, а за відсутності живого потоку даних побудувала власний тестовий харнес для валідації коду.
Безпека і обмеження
Opus 5 названо найбільш вирівняною моделлю компанії на сьогодні: 2.3 бала за загальною некоректною поведінкою в автоматизованому поведінковому аудиті, найнижчий рівень оманливої поведінки.
Цікавіша деталь у кібербезпеці. Модель майже наздогнала Mythos 5 у пошуку вразливостей, але суттєво відстає в розробці експлойтів для них. Це навмисна асиметрія: класифікатори дозволяють аналіз вихідного коду, але блокують бінарне сканування, пентест і генерацію експлойтів. За оцінкою Anthropic, спрацьовують вони приблизно на 85% рідше, ніж у Fable 5. Заблоковані запити за замовчуванням падають на Opus 4.8.
Підсумок
Opus 5 позиціонується не як найрозумніша модель на ринку, а як найвигідніша за співвідношенням результату до вартості. Для щоденної розробки та довгих агентних сценаріїв це, ймовірно, важливіше за кілька відсотків на топових бенчмарках.
Звучить ну дуже багатообіцяючи, тим більше доганяти конкурентів точно треба.
Що я б перевіряв сам:
