Американские компании переводят часть ИИ-нагрузки с дорогих закрытых моделей на решения с открытыми весами, и заметная доля этих решений родом из Китая. По данным Vercel, в августе 2026 года модели open-weight впервые обработали больше половины токенов в её AI Gateway, а доля выросла до 56% с менее чем 7% в декабре 2025 года.
Согласно Financial Times, с августа по сентябрь 2026 года руководители американских компаний упоминали open-source и open-weight технологии в выступлениях в 6 раз чаще, чем годом ранее, и интересуются уже не только айтишники, но и банки, логистика и тяжёлая промышленность. Открытые модели перемалывают 56% токенов Vercel, но забирают всего 14% расходов, ведь дорогие флагманы по-прежнему съедают львиную долю бюджета. Средняя цена токена в августе упала на 23,2%, и это 3-й месяц подряд с падением.
На OpenRouter китайские модели весь 2026 год сидят в верхних строчках рейтинга по объёму токенов. В летней статистике все 5 первых мест заняли китайские разработки:
▫️ Xiaomi;
▫️DeepSeek;
▫️MiniMax;
▫️Alibaba;
▫️Moonshot.
Стоит обратить внимание, что в июле китайские модели давали свыше 60% всего маршрутизируемого объёма при трафике более 20 трлн токенов в неделю.
Среди востребованных моделей числятся DeepSeek, Xiaomi, Tencent и Z.ai рядом с американскими системами. Рейтинг мерит только поток через API самого OpenRouter, поэтому за весь корпоративный рынок ИИ его выдавать нельзя.
Tinder начал переводить часть второстепенных запросов на open-weight модели, причина в счетах, по словам технического директора Виная Курувилы.
Годовая стоимость этой нагрузки в январе составляла около $1 млн, а к июлю выросла примерно в 10 раз. Когда сервис генерирует лавину запросов, разница в несколько центов на 1 млн токенов превращается в очень взрослый инвойс.
Американский бизнес не выкидывает OpenAI и Anthropic из инфраструктуры, а распределяет задачи по ценнику. Сложные запросы уходят в дорогую закрытую систему, а рутину получают модели дешевле:
▫️классификация документов;
▫️генерация типовых текстов;
▫️внутренний поиск;
▫️обработка больших массивов данных.
AT&T прогоняет около 45 млрд токенов в сутки через собственный AI Gateway, который выбирает модель под каждый запрос и умеет переключать её посреди многошагового диалога. Глава направления Data and AI Энди Маркус ранее рассказал, что оператор наращивает открытые модели ради экономии и специализации, ведь далеко не каждой задаче нужна модель верхнего ценового сегмента. В марте компания вступила в инициативу Open Telco AI и обучает открытые модели под телеком, где нейронка заранее знает оборудование и документацию отрасли.
Уточняется, что маршрутизация между моделями уже срезала расходы AT&T на ИИ до 90% и сэкономила компании миллионы долларов.
Открытые веса позволяют развернуть модель у себя и не отправлять каждый запрос внешнему вендору, что удобно для чувствительных данных. Бесплатным ИИ они при этом не становятся, потому что для самостоятельного запуска нужны:
▫️серверы и графические ускорители;
▫️хранилище;
▫️электричество;
▫️специалисты на обслуживание.
Железо для крупной модели легко съедает экономию, поэтому рынок идёт не к выбору между закрытым и открытым, а к связке вариантов с роутером-диспетчером на входе. OpenAI и Anthropic официально не обслуживают пользователей из РФ, поэтому для российских разработчиков open-weight остаётся способом добраться до современного ИИ без танцев с VPN и зарубежными картами. Слабое место в железе, ведь санкционные ограничения на поставки ускорителей Nvidia превращают локальный запуск крупных моделей в дорогое удовольствие.
Alibaba представила ускоритель Zhenwu V900 и анонсировала следующую модель:
▫️ускоритель должен выдавать примерно в 3 раза больше производительности, чем предыдущее поколение;
▫️массовое производство стартует в начале 2027 года;
▫️следующая модель получит от 5 до 10 трлн параметров при 2,4 трлн у нынешней.
🔗 Другие новости про хакеров, мошенников, утечки, ИБ, ИИ и ИТ можно прочитать здесь.
📤 Подписывайтесь на CISOCLUB в MAX
