TGViewer
KRUHLYK 🇺🇦 KRUHLYK 🇺🇦 @lets_code_ua · 1.33K subscribers
Post #1477 1.04K
Реліз, який я чекав вчора. Дуже гучні заяви і цифри, які варто ретельно перевірити.

Anthropic випустила Claude Opus 5

Anthropic представила Claude Opus 5 — модель, яка змінює логіку вибору між тірами. Основна теза анонсу: інтелект, близький до флагманського Fable 5, за половину вартості.

Ціна і доступ
5 доларів за млн вхідних токенів і 25 доларів за млн вихідних — так само, як в Opus 4.8. Тобто приріст якості не коштує нічого додатково. Доступна на всіх платформах, ідентифікатор в API — claude-opus-5. Є Fast mode зі швидкістю приблизно у 2.5 раза вищою за подвійну ціну. Модель стала дефолтною на Claude Max і найсильнішою на Claude Pro.

Що важливо для агентних систем
Два оновлення в беті мають більше практичного значення, ніж бенчмарки. Перше — зміна доступного набору інструментів усередині розмови без інвалідації prompt cache. Для мультиагентних пайплайнів зі змінним скоупом MCP це прямо впливає на вартість. Друге — автоматичні fallback-и на API: запит, позначений класифікатором безпеки, тепер маршрутизується на іншу модель, а не блокується.

Окремо наголошується на самоверифікації. У прикладах Anthropic модель, не маючи доступу до перегляду креслення, написала власний computer vision пайплайн, а за відсутності живого потоку даних побудувала власний тестовий харнес для валідації коду.

Безпека і обмеження
Opus 5 названо найбільш вирівняною моделлю компанії на сьогодні: 2.3 бала за загальною некоректною поведінкою в автоматизованому поведінковому аудиті, найнижчий рівень оманливої поведінки.

Цікавіша деталь у кібербезпеці. Модель майже наздогнала Mythos 5 у пошуку вразливостей, але суттєво відстає в розробці експлойтів для них. Це навмисна асиметрія: класифікатори дозволяють аналіз вихідного коду, але блокують бінарне сканування, пентест і генерацію експлойтів. За оцінкою Anthropic, спрацьовують вони приблизно на 85% рідше, ніж у Fable 5. Заблоковані запити за замовчуванням падають на Opus 4.8.

Підсумок
Opus 5 позиціонується не як найрозумніша модель на ринку, а як найвигідніша за співвідношенням результату до вартості. Для щоденної розробки та довгих агентних сценаріїв це, ймовірно, важливіше за кілька відсотків на топових бенчмарках.

Звучить ну дуже багатообіцяючи, тим більше доганяти конкурентів точно треба.

Що я б перевіряв сам: все реальну поведінку effort-рівнів на довгих пайплайнах і те, чи справді зберігається prompt cache при зміні MCP-скоупу мідсешн. Це два місця, де маркетинговий графік і продакшн зазвичай розходяться.
  • 🔥 12
  • ❤ 5
More from @lets_code_ua
  1. Oct 3, 2026Мало хто з вас знає, що за освітою я юрист-міжнародник. Магістр міжнародного комерційного…
  2. Oct 2, 2026Там вчора в нашому чаті були дискусії за можливості LLMок в архітектуру. Сьогодні в рамках…
  3. Oct 2, 2026Підтримую! Створюємо петицію?
  4. Oct 2, 2026Пʼятниця ніфіга не пʼятниця сьогодні.
  5. Oct 2, 2026Anthropic завіз моди в Claude Code. Це TypeScript функції, які чіпляються на будь-яку поді…
  6. Oct 1, 2026Post #1709
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →