TGViewer
Гриненко про ИИ, бизнес и образование Гриненко про ИИ, бизнес и образование @devspotting · 3.12K subscribers
Post #91 685
Когда подорожают токены?

В комментариях в этом канале и среди коллег часто звучит теория, что вот сейчас ушлые корпораты подсадят всех на иглу дешевого инференса, а потом (когда нас заменят на нейронки), ка-а-а-ак поднимут цены!

Предлагаю по случаю пятницы обсудить эту перспективку.

Самый популярный аргумент звучит так: подписки дотируются, чтобы захватить рынок и подсадить. И это правда. Исследователь под ником she-llac выяснил: Claude Max ($200/мес) дает эквивалент API вплоть до $3 600+ в месяц при теплом кэше. Claude Pro ($20) — в 16–37 раз дешевле, чем платить по API. То есть да — лаборатории сейчас банчат нейро-стафф по дешману.

Дальше — парадокс Джевонса: чем дешевле ресурс, тем больше его потребляют. Дешевые токены порождают новые SaaS, агентные пайплайны и прочие сценарии использования — спрос растет быстрее, чем падает цена. В результате у компаний появляется возможность для поднятия цен.

Наконец, более сложные модели объективно дороже, а дальнейшее масштабирование требует железа на порядки больше — квадратичный рост вычислений ради линейного прироста качества.

И что же? Остается срочно навайбкодить себе единорога, пока лавочка не закрылась?

Почему я в это не верю
Для начала такой факт: с 2023 по 2026 год цена за токен упала в 1000+ раз. GPT-4 стоил $30/60 за 1M токенов — сегодня Qwen3.5 или Gemma 3n дают сопоставимые возможности за $0.02–0.03. И тенденция скорее ускоряется:

- Железо — H100 → Blackwell → Rubin: каждое поколение дает 2–3x токенов/доллар. HBM4 поднимает утилизацию чипов до 90%.
- Альтернативные чипы — TPU, специализированный AI-silicon: Midjourney уже сэкономил $16M/год, просто сменив железо.
- Алгоритмы — дистилляция снижает затраты в 10–100x, модели становятся меньше и умнее одновременно. TurboQuant, придуманный для оптимизации KV-кэша, в сообществе уже пробуют применять для сжатия весов.
- Инфраструктура — batch API дает скидку 50%, кэширование контекста режет реальные расходы в разы. Stateless/elastic инференс убивает idle-costs.

Общий тренд: снижение цены на порядок ежегодно — быстрее, чем в PC или интернете в эпоху доткома.

Открытые модели и локальный инференс
Уже сейчас на пусть и недешевом, но все еще бытовом железе можно запустить Gemma 4, Nemotron, gpt-oss и целый зоопарк от китайских лабораторий.

Судя по всему, к моменту, когда пессимисты ожидают повышения цен, на средних ноутбуках можно будет запускать модели уровня Claude Sonnet 4.5.

Конкуренция между OpenAI, Anthropic, Google, DeepSeek и прочими китайцами — структурная. Ни один из них не может поднять цены, не потеряв рынок. А с открытыми весами у корпоративных пользователей появляется полноценная альтернатива.

В конце концов, на интернет ведь тоже всех подсадили, но мы спокойно берем безлимитные мобильные пакеты и смотрим 4k-видео в метро (не в Москве, конечно, откуда тут мобильный интернет в 2026?).

Так что я ожидаю, что для бытовых задач мы получим модели в разы мощнее нынешних SOTA за пренебрежительно дешевую подписку, а для промышленного использования стоимость токенов будет иметь примерно такое же значение, как сейчас стоимость трафика для SaaS-компаний — да, петабайты стоят денег, но это точно не фактор, который определяет финмодель.

Разубедите?

@devspotting
  • 👍 20
  • 🔥 4
  • 😁 1
More from @devspotting
  1. Sep 22, 2026Обсуждаем Jev в седьмом выпуске «ИИ — не новостей» с Сергеем @veged_and_code Бережным Кром…
  2. Sep 17, 2026#ГриненкоПро №25 с Анастасией Бианко, руководителем отдела подбора персонала в Циан https:…
  3. Sep 17, 2026Аркадий, а что мы ускорили? Помните Аркадия, которого мы просили убрать руки с клавиатуры?…
  4. Sep 16, 2026На OpenRouter очередная бесплатная стелс-модель — Union Alpha. UPD: лавочка закрылась, мод…
  5. Sep 15, 2026Шестой выпуск «ИИ — не новостей» уже на Ютубе (или на ваших любимых стримингах). На этот р…
  6. Sep 15, 2026But I'm likely human after all I'm likely human after all Don't put your blame on me Don't…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →