📉 Подорожают ли токены на AI? Разбираемся серьёзно
Короткий ответ: цена за токен — нет, скорее всего продолжит падать. А вот ваш счёт за AI — почти наверняка вырастет. Парадокс? Сейчас объясню.
Я покопался в исследованиях и аналитике, и вот что получается.
🔬 Какие методики прогнозирования существуют?
Есть три ключевых фреймворка, на которые опираются прогнозы:
1️⃣ LLMflation (a16z) — партнёр Andreessen Horowitz Мартин Каспер ввёл термин по аналогии с дефляцией. Суть: стоимость инференса модели эквивалентного качества падает примерно в 10 раз каждый год. То, что стоило $60 за миллион токенов в 2021 году, сейчас стоит $0.06. За 3 года — падение в 1000 раз. Это быстрее, чем падение стоимости вычислений во время PC-революции или трафика во время доткомов.
Источник
2️⃣ Densing Law — исследование из Nature Machine Intelligence (Xiao et al.). Плотность способностей LLM (capability per parameter) удваивается каждые ~3.5 месяца. То есть каждые 3 месяца модель с вдвое меньшим количеством параметров достигает уровня текущего SOTA. За всё время наблюдений стоимость инференса на уровне GPT-3.5 упала в 266 раз.
Источник
3️⃣ Прогноз Gartner (март 2026) — к 2030 году стоимость инференса модели с 1 триллионом параметров упадёт на 90%+ по сравнению с 2025. LLM станут в 100 раз дешевле, чем первые модели аналогичного размера в 2022.
Источник
Вообще для того чтобы спрогнозировать возможные сценарии мы можем использовать что-то типа физики. Только физики цен. Нужно разобрать, какие силы двигают цену вниз, а какие вверх. Давайте глянем:
⬇️ Силы, которые давят цену ВНИЗ
🟢 Железо — каждое новое поколение GPU даёт больше FLOPS за доллар (тот же Moore's Law, только для ускорителей)
🟢 Оптимизация моделей — квантизация (с 16-bit до 4-bit), дистилляция, новые архитектуры вроде Mixture of Experts
🟢 Ценовая война — в марте 2026 провайдеры устроили полноценную price war. То, что стоило $100/мес в феврале, в апреле стоит $40-60. DeepSeek вышел с ценами на 90% ниже конкурентов, Google субсидирует Gemini для захвата рынка, Anthropic порезал Opus 4.5 на 67%
🟢 Densing Law — модели становятся компактнее при том же качестве, а значит дешевле в инференсе
🟢 Экономия масштаба — чем больше пользователей, тем дешевле каждый запрос (батчинг, переиспользование KV-кэша)
⬆️ Силы, которые давят расходы ВВЕРХ
🔴 Агентные воркфлоу — один пользовательский запрос теперь может вызывать 10-20 обращений к LLM (цепочки рассуждений, tool use, планирование)
🔴 RAG и длинные контексты — контекстные окна раздуваются в 3-5x, каждый вызов жрёт больше токенов
🔴 Always-on агенты — мониторинг, автоматизация, непрерывные процессы потребляют compute 24/7
🔴 Парадокс Джевонса — когда ресурс дешевеет, его потребляют непропорционально больше. Google внутри увеличил потребление токенов в 130 раз за 18 месяцев
📊 Что говорят цифры прямо сейчас?
Текущие цены (апрель 2026, input/output за 1M токенов):
- GPT-5.2: $1.75 / $14
- Claude Opus 4.5: $5 / $25 (после снижения на 67%)
- Gemini 3.1 Pro: $2 / $12
- DeepSeek: $0.55 / $2.19
Для сравнения, GPT-4 при запуске стоил $30 / $60. Падение в 10-20 раз за 3 года!!!
При этом общие мировые расходы на AI в 2026 — $2.52 триллиона (Gartner), рост 44% год к году. Облачные расходы на AI-инференс выросли с $11.5B в 2024 до $37B в 2025 — в 3 раза. А токены при этом подешевели на 95%. Парадокс Джевонса во всей красе!
🎯 Итого
😏 Цена за токен продолжит падать — это подтверждают и эмпирические данные (LLMflation, Densing Law), и прогнозы (Gartner), и рыночная конкуренция
🟢 Если вы делаете простые запросы к API — ваш счёт скорее всего уменьшится или останется прежним
🔴 Если вы строите агентные системы, RAG-пайплайны или автоматизацию — готовьтесь к тому, что потребление токенов вырастет быстрее, чем упадёт цена
⚡ Главный инсайт: удешевление токенов не равно удешевлению AI. Парадокс Джевонса в действии — чем дешевле единица, тем больше мы потребляем. Я его на себе точно ощущаю – работы стало больше. Теперь я кодю буквально на ходу наговаривая изменения клоду через телегу.
Post #6
76