Claude Opus 5.5: що зміниться у вашій щоденній роботі
Anthropic сьогодні випустила Opus 5.5 — першу модель лінійки 5.5. Sonnet 5.5 і Haiku 5.5 обіцяють найближчими тижнями. Без маркетингу — де різницю реально відчуєте.
1. Відповіді, які легко читати. Головне на початку, менше жаргону, модель краще тримається ваших правил стилю. Це була одна з найчастіших скарг на Opus 5.
2. Швидше і менше кроків. Генерація тексту на 30%+ швидша. В агентних задачах модель робить менше tool calls і рідше застрягає в повторних спробах. Партнери з раннього доступу (GitHub, Lovable, Kiro) повідомляють про скорочення кроків на третину–половину.
3. Довгі задачі в Claude Code. Міграції, аудити кодової бази, нічні автономні прогони. Приклад від одного з тестувальників: аудит і фікс 200K рядків коду менш ніж за 3 години проти 20+ годин у Opus 5.
4. Менше вигаданих фактів у ресерчі. У тесті Anthropic 16 з 18 звітів Opus 5.5 пройшли перевірку, де будь-яка вигадана цифра чи цитата означала провал. Fable 5.1 і Opus 5 не пройшли жодного разу.
5. Скріншоти й графіки. Значення з щільних діаграм і скріншотів модель зчитує помітно точніше.
6. Більше лімітів. На Pro, Max і Team підняли п'ятигодинні ліміти й дали разовий скид, який можна зберегти на потім.
Для тих, хто працює через API
— Ціна: $4 / $20 за 1M токенів (Opus 5: $5 / $25), cache read $0.20 замість $0.50.
— Effort за замовчуванням тепер
medium, а не high. Частина заявленої економії 40% саме звідси, тож порівнюйте на своїх задачах з явно заданим effort.— Breaking changes: thinking не вимикається;
tool_choice з типом any або tool повертає 400; текст між tool calls тепер приходить у thinking-блоках і за замовчуванням порожній — ваш UI просто замовкне без жодної помилки.Де може заважати
Більшість задач з кібербезпеки модель автоматично передає на Opus 4.8. Звичайний пошук і фікс багів у власному коді це не зачіпає. Біологія — під тими ж обмеженнями, що й Fable 5.1.
Чесно про бенчмарки
За даними Anthropic: 66.4% на Terminal-Bench 4.0 проти 52.3% у Opus 5. Але сама компанія визнає, що на цьому рівні різниця в бенчмарках погано відображає реальну. Тож головний тест — ваш власний проєкт.
Першоджерела: https://www.anthropic.com/claude-opus-5-5
