TGViewer
ТрансформаторX ТрансформаторX @transformerxx · 2.67K subscribers
Post #2099 513
Железо дорожает, но ИИ становится дешевле. Как так?

Глянул интервью гендира Yandex Cloud Григория Атрепьева Ведомостям. Вообще, там на редкость "мясной" контент про агентов, ИИ-кибербез, что делать с сотрудниками и немного про планы самого Яндекса в ИИ. Но я хочу остановиться на конкретном моменте про ИИ-вычисления, важным для всей ИИ-индустрии.

Смотрите, сейчас в ИИ-вычислениях происходит довольно странная штука:
1. Железо очевидно дорожает. Серверы за год улетели в 2–5 раз, адски подорожала память и всё остальное.
2. Но токены (то есть, сколько результата модель на конкретном железе делает юзеру за Х времени) при этом дешевеют. Атрепьев приводит цифры самого Яндекса: у них выручка на тот же объём токенов упала за год в 6 раз, а по классу "лёгких" Flash-моделей цена снизилась почти в 14 раз.

Это, вообще говоря, парадокс. Обычно, если сырьё дорожает, то продукт тоже дорожает. А тут наоборот. Давайте разберёмся - почему так (здесь ключевое из статьи дополню своими мыслями).

Смотрите, себестоимость токена для провайдера (для OpenAI, Anthropic или того же Яндекса) считается так:
🤩 Числитель = стоимость часа работы одной GPU. Сколько стоит, чтобы одна видеокарта крутилась один час, включая её амортизацию, обслуживание, инженеров, электричество и всё-всё-всё.
🤩 Знаменатель = число токенов, которые она за этот час обработала.

Так вот, числитель вырос примерно в 2-5 раз, но знаменатель - гораздо сильнее. Причин несколько, и они работают вместе и усиливают друг друга:

1. Модели стали дешевле в исполнении при сопоставимом качестве. ИИ-компании выкатывают Flash-версии, и это не "урезанные модели-обрубки", как многие думают, а иначе спроектированные. Например, с применением MoE (Mix of Experts), где на разные токены бросается не вся модель, а нужный кусок.

2. Рост входящих токенов. Токены бывают разные. Есть входные (промпты, документы), где модель берёт весь текст и обрабатывает всё разом, параллельно. А есть выходные, которая модель выдаёт. Их нужно генерить по одному, перечитывая все веса из памяти на каждое новое слово (ну, если грубо). Так вот, входящие токены сильно дешевле, и их доля сильно выросла. Я думаю, это потому что юзеры привыкли кидать в модель не чёткий промпт или хотя бы структурированный запрос, а всё подряд - кучу несвязного текста огромными кусками, пдф-доки и т.д. И если считать с т.з. расхода токенов - это дешевле. У Яндекса соотношение 4:1 в пользу дешёвых.

3. Кэш. Если у тысячи запросов одинаковое начало (системный промпт, история чата и т.д.), то модели достаточно переварить один раз, а дальше брать куски из готового. Провайдеру это сильно дешевле. В том же DeepSeek V4 Flash кэшированных запросов около 70% токенов - то есть, агент 7 из 10 шагов шлёт почти одно и то же. И доля кэшированных запросов растёт. Почему - не буду углубляться, иначе свалимся в дебри, но если кратко, то тут и рост агентных цепочек, и более многоходовые чаты, и популярность системных промптов (например, в корп поддержке), и много что ещё.

4. Наконец, сама инженерия инференса: батчинг (прогнать через одни веса не одного юзера, а сразу кучу), квантизация, более продвинутое декодирование и т.д. Прикол в том, что всё это работает на большом потоке (нет одновременных запросов - нечего объединять). А поток, как вы понимаете, растёт.

Теперь главное - что это меняет, и что делать. У провайдеров выручка отвязалась от объёма: теперь чтобы стоять на месте - надо расти по токенам в 5-6 раз в год. Ещё, им придётся сильнее гнаться за плотностью, отсюда и амбиции занять "половину рынка" (тренд на укрупнение), и буст агентов в мессенджерах (= генераторы потока), и активная работа с партнёрами, которые приводят доп нагрузку. А для клиента ограничение теперь сидит не в цене, а в умении хорошо внедрять и наращивать полезное потребление. Потому что агенты, которые жгут на порядок больше, наконец начинают окупаться на дешевеющих токенах. Ну и главное узкое место индустрии - это теперь окончательно память, а не сами вычисления.
  • 🤓 10
  • 👨‍💻 8
  • 💯 3
  • 🤯 2
  • 👍 1
  • 🔥 1
  • 👏 1
More from @transformerxx
  1. Sep 22, 2026Хочешь быть в курсе всех финансовых новостей раньше всех? Тогда тебе точно к нам! 🤑 В зак…
  2. Sep 22, 2026😱Боитесь упустить очередной криптовалютный тренд? 📝 Хотите знать, как заработать, не под…
  3. Sep 22, 2026Post #2097
  4. Sep 22, 2026Вы можете залить ваш трек на страницу любой звезды в Spotify, получить его прослушивания,…
  5. Sep 22, 2026Post #2095
  6. Sep 21, 2026Налоговая увидела новость про муху:
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →