— Скорость вывода токенов выросла примерно в 2.5 раза
— Это та же модель, те же веса и возможности — не облегчённая версия
— Ускорение достигается за счёт более «агрессивной» конфигурации инференса
— Важно: быстрее становится именно генерация ответа, а не время до первого токена
Дополнительно:
Все пользователи Claude Pro и Max получили $50 бонусного лимита, который можно использовать для Fast Mode в Claude Code.
Как включить:
- В API:
speed: "fast" (в бета-режиме) - В Claude Code: команда
/fast или настройка fastModeНюансы, о которых стоит знать:
— Fast и Standard считаются разными конфигурациями → ломается prompt caching
Если переключиться посреди диалога, кэш не сработает и придётся платить за весь контекст заново.
— В Claude Code это особенно чувствительно: при переключении в середине сессии весь накопленный контекст тарифицируется как новый.
— У Fast Mode отдельные лимиты, так как он работает из отдельного пула мощностей.
— Режим доступен только в сервисах Anthropic (Claude Code, Console, API).
В Bedrock, Vertex AI и Azure его пока нет.
По цене:
Standard:
- $5 за 1M input
- $25 за 1M output
Fast Mode (до 200K контекста):
- $30 за 1M input
- $150 за 1M output
То есть примерно в 6 раз дороже.
Вывод:
Fast Mode — полезный переключатель для интерактивных задач:
- live-кодинг
- дебаг
- быстрые правки
- агентные циклы
Но из-за цены его имеет смысл включать только там, где узкое место — именно задержка, а не стоимость.
code.claude.com/docs/en/fast-mode

