Железо дорожает, но ИИ становится дешевле. Как так?
Глянул интервью гендира Yandex Cloud Григория Атрепьева Ведомостям. Вообще, там на редкость "мясной" контент про агентов, ИИ-кибербез, что делать с сотрудниками и немного про планы самого Яндекса в ИИ. Но я хочу остановиться на конкретном моменте про ИИ-вычисления, важным для всей ИИ-индустрии.
Смотрите, сейчас в ИИ-вычислениях происходит довольно странная штука:
1. Железо очевидно дорожает. Серверы за год улетели в 2–5 раз, адски подорожала память и всё остальное.
2. Но токены (то есть, сколько результата модель на конкретном железе делает юзеру за Х времени) при этом дешевеют. Атрепьев приводит цифры самого Яндекса: у них выручка на тот же объём токенов упала за год в 6 раз, а по классу "лёгких" Flash-моделей цена снизилась почти в 14 раз.
Это, вообще говоря, парадокс. Обычно, если сырьё дорожает, то продукт тоже дорожает. А тут наоборот. Давайте разберёмся - почему так (здесь ключевое из статьи дополню своими мыслями).
Смотрите, себестоимость токена для провайдера (для OpenAI, Anthropic или того же Яндекса) считается так:
🤩 Числитель = стоимость часа работы одной GPU. Сколько стоит, чтобы одна видеокарта крутилась один час, включая её амортизацию, обслуживание, инженеров, электричество и всё-всё-всё.
🤩 Знаменатель = число токенов, которые она за этот час обработала.
Так вот, числитель вырос примерно в 2-5 раз, но знаменатель - гораздо сильнее. Причин несколько, и они работают вместе и усиливают друг друга:
1. Модели стали дешевле в исполнении при сопоставимом качестве. ИИ-компании выкатывают Flash-версии, и это не "урезанные модели-обрубки", как многие думают, а иначе спроектированные. Например, с применением MoE (Mix of Experts), где на разные токены бросается не вся модель, а нужный кусок.
2. Рост входящих токенов. Токены бывают разные. Есть входные (промпты, документы), где модель берёт весь текст и обрабатывает всё разом, параллельно. А есть выходные, которая модель выдаёт. Их нужно генерить по одному, перечитывая все веса из памяти на каждое новое слово (ну, если грубо). Так вот, входящие токены сильно дешевле, и их доля сильно выросла. Я думаю, это потому что юзеры привыкли кидать в модель не чёткий промпт или хотя бы структурированный запрос, а всё подряд - кучу несвязного текста огромными кусками, пдф-доки и т.д. И если считать с т.з. расхода токенов - это дешевле. У Яндекса соотношение 4:1 в пользу дешёвых.
3. Кэш. Если у тысячи запросов одинаковое начало (системный промпт, история чата и т.д.), то модели достаточно переварить один раз, а дальше брать куски из готового. Провайдеру это сильно дешевле. В том же DeepSeek V4 Flash кэшированных запросов около 70% токенов - то есть, агент 7 из 10 шагов шлёт почти одно и то же. И доля кэшированных запросов растёт. Почему - не буду углубляться, иначе свалимся в дебри, но если кратко, то тут и рост агентных цепочек, и более многоходовые чаты, и популярность системных промптов (например, в корп поддержке), и много что ещё.
4. Наконец, сама инженерия инференса: батчинг (прогнать через одни веса не одного юзера, а сразу кучу), квантизация, более продвинутое декодирование и т.д. Прикол в том, что всё это работает на большом потоке (нет одновременных запросов - нечего объединять). А поток, как вы понимаете, растёт.
Теперь главное - что это меняет, и что делать. У провайдеров выручка отвязалась от объёма: теперь чтобы стоять на месте - надо расти по токенам в 5-6 раз в год. Ещё, им придётся сильнее гнаться за плотностью, отсюда и амбиции занять "половину рынка" (тренд на укрупнение), и буст агентов в мессенджерах (= генераторы потока), и активная работа с партнёрами, которые приводят доп нагрузку. А для клиента ограничение теперь сидит не в цене, а в умении хорошо внедрять и наращивать полезное потребление. Потому что агенты, которые жгут на порядок больше, наконец начинают окупаться на дешевеющих токенах. Ну и главное узкое место индустрии - это теперь окончательно память, а не сами вычисления.
Post #2099
513
- 🤓 10
- 👨💻 8
- 💯 3
- 🤯 2
- 👍 1
- 🔥 1
- 👏 1