В агентном кодинге большая часть запроса повторяется снова и снова: системный промпт, tool-схемы, история диалога, правила проекта и контекст файлов.
Обычная тарификация считает это как обычные prompt tokens.
В Clodex cached tokens учитываются отдельно и списываются дешевле.
Это особенно заметно в:
Codex, Cursor, Claude Code, Cline и других coding agents.
Как это работает у нас:
GPT-5.4 — x1
GPT-5.5 — x2.25
GPT-5.4 mini — x0.45
Claude Sonnet / Haiku / Opus — x1
А повторяющийся cached context считается по сниженной ставке.
Для GPT-5.5 cached tokens списываются примерно как x0.9, то есть заметно дешевле обычных x2.25.
Итог простой: в длинных coding-сессиях баланс живет дольше, потому что повторяющийся контекст не сжигается как новый каждый раз.
Мы не кэшируем ответы и не подменяем результат.
Экономия идет именно за счет prompt cache: модель отвечает на актуальный запрос, а уже знакомая часть контекста тарифицируется мягче.
