Мы рады сообщить что добавили prompt caching — теперь повторяющиеся части запросов не нужно оплачивать по полной цене каждый раз.
Как это работает:
— При первом запросе повторяющаяся часть промпта (системные инструкции, длинный контекст, документы, история диалога) сохраняется в кеш.
— При следующих запросах с тем же содержимым модель берёт эту часть из кеша вместо полной повторной обработки — вы платите значительно меньше и получаете ответ быстрее.
— Кеш особенно выгоден при длинных системных промптах, для AI-инструментам для кодинга и повторяющемся контексте.
Цены:
— Создание кеша —
$0.5 за 1 000 000 токенов.— Чтение из кеша —
$0.04 за 1 000 000 токенов.Также:
— Добавлены новые модели — актуальный список смотрите в документации.
— Увеличена скорость ответа на всех уже существующих моделях.
——————
⚡️ Prompt Caching
We're happy to announce that we've added prompt caching — repeated parts of your requests no longer need to be paid for at full price every time.
How it works:
— On the first request, the repeated part of the prompt (system instructions, long context, documents, chat history) gets saved to cache.
— On subsequent requests with the same content, the model reads that part from cache instead of reprocessing it fully — you pay significantly less and get faster responses.
— Caching is especially useful for long system prompts, AI coding tools, and repeated context.
Pricing:
— Cache creation —
$0.5 per 1,000,000 tokens.— Cache read —
$0.04 per 1,000,000 tokens.Also:
— New models added — check the up-to-date list in the docs.
— Response speed increased across all existing models.