OPUS 5.5: ДЕШЕВЛЕ, БЫСТРЕЕ, УМНЕЕ. НО ЕСТЬ НЮАНС
Вчера Anthropic выпустила Claude Opus 5.5.
Обычно новая модель означает немного лучшие бенчмарки и немного более высокий счёт за API. Здесь получилось наоборот.
Opus 5.5 стоит $4 за миллион входных токенов и $20 за миллион выходных. У Fable 5.1 — $10 и $50. То есть новая модель дешевле в 2,5 раза.
При этом в опубликованных тестах она обходит Fable 5.1:
• Terminal-Bench 4.0: 66,4% против 55,8%
• CursorBench 4.0: 57,8% против 51,8%
• GDPval-AA: 1846 против 1735
• Humanity’s Last Exam: 67,7% против 65,6%
Но бенчмарки — это ещё не реальная работа. Особенно когда речь идёт не о чат-боте, а об AI-специалисте.
Я перевёл своих AI-специалистов, которые раньше работали на Opus 5, на Opus 5.5. По моим наблюдениям, те же задачи они начали выполнять примерно на 50% быстрее.
И это очень заметная разница.
Но вместе с ускорением я увидел и то, что меня тревожит: поведение специалистов изменилось.
У моих AI-специалистов есть harness — роли, методологии, ограничения, рабочие процессы и правила проверки результата. Именно этот контур превращает обычную языковую модель в специалиста с определёнными обязанностями.
Казалось бы, мы поменяли только модель. Роль осталась прежней. Методология не изменилась. Инструменты те же.
Но исполнять этот контракт Opus 5.5 начала иначе.
Это важный момент, который легко пропустить на фоне красивых цифр. Новая модель может быть умнее и быстрее, но это не означает, что её можно просто подставить вместо старой и считать миграцию законченной.
Она иначе интерпретирует инструкции, принимает решения и расставляет приоритеты. Значит, поведение всей агентной системы тоже меняется.
Модель в AI-специалисте — не сменный двигатель, который можно заменить, не трогая остальную конструкцию. Она является частью архитектуры.
Поэтому после перехода на Opus 5.5 мне придётся заново проверять роли и методологии на реальных сценариях: где ускорение действительно полезно, а где новая модель начала слишком свободно трактовать свои полномочия.
Моё мнение: Opus 5.5 — серьёзное обновление. Она дешевле, быстрее и по бенчмаркам сильнее Fable 5.1. Для моих AI-специалистов она уже становится основной моделью.
Но любая смена модели в агентной системе — это не обновление зависимости.
Это миграция поведения.
Post #158
72

- 👍 4
- 🔥 4
- 🤝 2
- 🤔 1
- 💅 1