Почему 1М контекста в Opus 4.6 — маркетинговый трюк
Наверняка вы уже слышали, что Anthropic выпустили Opus 4.6, а OpenAI свою GPT-5.3 Codex почти одновременно.
Графики красивые, хайпа много, но что на самом деле стоит за ними? Давайте разбираться.
Сразу спойлер: никакой революции не произошло (впрочем, как и с 1M контекста в Sonnet'ах), но мы постепенно движемся в правильном направлении.
Что нам расказали Anthropic?
1. Opus 4.6 показала лучшие результаты в тесте 8-NIAH, набрав целых 76% точности. Значительно обгоняя Sonnet 4.5 (18.5%) и Gemini 3 Pro (26.3%).
2. Начинания с 200к токенов контекстного окна новая модель будет тарифицироваться по «премиальному прайсингу»: $10 за миллион входных токенов и $37.50 за тот же миллион, но на выходе… Да, c фразой для описания стоимости ребята не ошиблись.
Что это значит нормальным языком?
1. Opus 4.6 на самом деле не умеет работать с большим контекстом. В другом посте я уже рассказывал про тест Needle-In-A-Haystack. 8-NIAH — это тоже самое, но вместо одного кусочка данных по тексту разбросаны уже 8 одинаковых кусочков данных, каждый из которых модели нужно найти. Да, Opus 4.6 стала справляться с этой задачей гораздо лучше остальных моделей... но думаю, что и без моих объяснений понятно, что тест синтетический, нежели, чем практический. А других тестов нам и не показали, следовательно ситуация там плачевная. Для референса: все топовые модели с поиском одной иголки справляются в 100% случаев, вне зависимости от размера контекстного окна.
2. Opus 4.6 никак не решает проблему с ростом стоимости контекста. Во всех моделях, за исключением DeepSeek-V3.2, цена за токен линейно растёт вместе с ростом контекстного окна. Так, если первая тысяча токенов стоит $0.001, то вторая будет стоить уже $0.002, третья $0.003 и так далее. Таким образом, в диапазоне от 200к до 1М контекста стоимость токенов будет составлять от $0.20 до $1.00 за тысячу. Получается, что первые 200к токенов обойдутся вам в $20.00, а следующие 800к в $480.00. То есть относительная цена увеличится в 6 раз. В AI-лабах об этом прекрасно знают в связи с чем сильно задирают ценник на большие контекстные окна.
Собственно, это и есть две причины почему компании ограничивают контекстное окно в районе ~200к токенов: стремительная деградация ответов и взрывной рост стоимости. И да, Opus 4.6, как я и сказал ранее ни одну из этих проблем не решает, а после 200к токенов модель становится настолько дорогой, что всё равно никто не узнает как она тупит на огромных контекстах, ведь никто ей не будет пользоваться. Великолепно разыгранная партия, Anthropic!
Самое забавное во всей этой истории наверное то, что DeepSeek ещё в прошлом году решили проблему с линейным ростом стоимости, сохранив низкую стоимость токенов на всём пути, а сейчас они активно занимаются решением проблемы с деградацией ответов при росте контекстного окна. Об этом мы ещё с вами обязательно поговорим:)
Чувствую, что в ближайшие пару месяцев китайский кит поразит нас громким релизом DeepSeek-V4.
Post #77
341

- 🔥 12
- ❤ 3
- 👏 3