TGViewer
Нейросети на практике Нейросети на практике @neuralfordevs · 65 subscribers
Post #6 76
📉 Подорожают ли токены на AI? Разбираемся серьёзно

Короткий ответ: цена за токен — нет, скорее всего продолжит падать. А вот ваш счёт за AI — почти наверняка вырастет. Парадокс? Сейчас объясню.

Я покопался в исследованиях и аналитике, и вот что получается.

🔬 Какие методики прогнозирования существуют?

Есть три ключевых фреймворка, на которые опираются прогнозы:

1️⃣ LLMflation (a16z) — партнёр Andreessen Horowitz Мартин Каспер ввёл термин по аналогии с дефляцией. Суть: стоимость инференса модели эквивалентного качества падает примерно в 10 раз каждый год. То, что стоило $60 за миллион токенов в 2021 году, сейчас стоит $0.06. За 3 года — падение в 1000 раз. Это быстрее, чем падение стоимости вычислений во время PC-революции или трафика во время доткомов.
Источник

2️⃣ Densing Law — исследование из Nature Machine Intelligence (Xiao et al.). Плотность способностей LLM (capability per parameter) удваивается каждые ~3.5 месяца. То есть каждые 3 месяца модель с вдвое меньшим количеством параметров достигает уровня текущего SOTA. За всё время наблюдений стоимость инференса на уровне GPT-3.5 упала в 266 раз.
Источник

3️⃣ Прогноз Gartner (март 2026) — к 2030 году стоимость инференса модели с 1 триллионом параметров упадёт на 90%+ по сравнению с 2025. LLM станут в 100 раз дешевле, чем первые модели аналогичного размера в 2022.
Источник

Вообще для того чтобы спрогнозировать возможные сценарии мы можем использовать что-то типа физики. Только физики цен. Нужно разобрать, какие силы двигают цену вниз, а какие вверх. Давайте глянем:

⬇️ Силы, которые давят цену ВНИЗ

🟢 Железо — каждое новое поколение GPU даёт больше FLOPS за доллар (тот же Moore's Law, только для ускорителей)
🟢 Оптимизация моделей — квантизация (с 16-bit до 4-bit), дистилляция, новые архитектуры вроде Mixture of Experts
🟢 Ценовая война — в марте 2026 провайдеры устроили полноценную price war. То, что стоило $100/мес в феврале, в апреле стоит $40-60. DeepSeek вышел с ценами на 90% ниже конкурентов, Google субсидирует Gemini для захвата рынка, Anthropic порезал Opus 4.5 на 67%
🟢 Densing Law — модели становятся компактнее при том же качестве, а значит дешевле в инференсе
🟢 Экономия масштаба — чем больше пользователей, тем дешевле каждый запрос (батчинг, переиспользование KV-кэша)

⬆️ Силы, которые давят расходы ВВЕРХ

🔴 Агентные воркфлоу — один пользовательский запрос теперь может вызывать 10-20 обращений к LLM (цепочки рассуждений, tool use, планирование)
🔴 RAG и длинные контексты — контекстные окна раздуваются в 3-5x, каждый вызов жрёт больше токенов
🔴 Always-on агенты — мониторинг, автоматизация, непрерывные процессы потребляют compute 24/7
🔴 Парадокс Джевонса — когда ресурс дешевеет, его потребляют непропорционально больше. Google внутри увеличил потребление токенов в 130 раз за 18 месяцев

📊 Что говорят цифры прямо сейчас?

Текущие цены (апрель 2026, input/output за 1M токенов):
- GPT-5.2: $1.75 / $14
- Claude Opus 4.5: $5 / $25 (после снижения на 67%)
- Gemini 3.1 Pro: $2 / $12
- DeepSeek: $0.55 / $2.19

Для сравнения, GPT-4 при запуске стоил $30 / $60. Падение в 10-20 раз за 3 года!!!

При этом общие мировые расходы на AI в 2026 — $2.52 триллиона (Gartner), рост 44% год к году. Облачные расходы на AI-инференс выросли с $11.5B в 2024 до $37B в 2025 — в 3 раза. А токены при этом подешевели на 95%. Парадокс Джевонса во всей красе!

🎯 Итого

😏 Цена за токен продолжит падать — это подтверждают и эмпирические данные (LLMflation, Densing Law), и прогнозы (Gartner), и рыночная конкуренция
🟢 Если вы делаете простые запросы к API — ваш счёт скорее всего уменьшится или останется прежним
🔴 Если вы строите агентные системы, RAG-пайплайны или автоматизацию — готовьтесь к тому, что потребление токенов вырастет быстрее, чем упадёт цена
⚡ Главный инсайт: удешевление токенов не равно удешевлению AI. Парадокс Джевонса в действии — чем дешевле единица, тем больше мы потребляем. Я его на себе точно ощущаю – работы стало больше. Теперь я кодю буквально на ходу наговаривая изменения клоду через телегу.
Andreessen Horowitz Welcome to LLMflation - LLM inference cost is going down fast ⬇️ | Andreessen Horowitz For LLM of equivalent performance, the inference cost is decreasing by 10x every year. What cost $60/million tokens in 2021 costs $.06/million tokens today.
  • ❤ 1
More from @neuralfordevs
  1. Jul 30, 2026🤔 Что выбрать новичку Claude или Codex? Это вопрос, который я часто слышу от тех, кто тол…
  2. Jul 15, 2026#разрушителимифов У Димы, чей разгромный тест Caveman я упоминал неделю назад, вышло новое…
  3. Jul 15, 2026Таки не заленился и написал статью про Headroom!)
  4. Jul 13, 2026Как работает кэш токенов? В процессе написания статьи про HeadroomProxy чуть глубже погруз…
  5. Jul 7, 2026🍄 Разрушители мИИфов: тестируем Headroom Когда я писал прошлый разбор про Caveman, то на…
  6. Jun 23, 2026💡 Мысль дня: Устаревание контента и забывание – ключевой процесс для корпоративной Базы з…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →