Inspur выпустила супернод на 128 GPU с задержкой генерации токенов 5,85 мс
Inspur Information представила AI-сервер Yuan Nao SD200 Ultra — супернод на 128 GPU с поддержкой унифицированной адресации видеопамяти. При запуске модели Kimi K3 с 2,8 триллиона параметров задержка генерации токена составила 5,85 мс, скорость вывода для одного пользователя — 170 токенов в секунду. По заявлению компании, это первый китайский продукт, вышедший на уровень международных решений первого ряда.
Супернод отличается от обычного кластера GPU тем, что все ускорители видят общую память напрямую, без промежуточных протоколов и маршрутизации. Это сокращает накладные расходы на коммуникацию: время операции Allreduce снизилось в 3,5 раза по сравнению со стандартной схемой. Чипы обмениваются данными так, как если бы обращались к локальной памяти соседнего GPU.
Главный AI-стратег Inspur Information Лю Цзюнь объяснил логику выбора размера суперноды. По его словам, наращивать число чипов до бесконечности нецелесообразно: чем дальше данные от вычислений, тем выше стоимость передачи и планирования, и в какой-то момент она перекрывает выигрыш от масштаба. Плюс растёт риск отказов всего домена. Inspur остановилась на 128 GPU как на балансе между ёмкостью памяти и управляемостью.
Конкуренты придерживаются разных подходов. Alibaba Cloud Lingji Zhenwu M890 строит домен масштабирования из 64 GPU и расширяет его через сеть горизонтального масштабирования. Huawei Ascend 950 охватывает от нескольких сотен до нескольких тысяч чипов в одном домене.
Лю Цзюнь обозначил и сдвиг в бизнес-модели: раньше вендоры продавали серверы, теперь берут на себя ответственность за то, чтобы клиент реально производил токены — включая адаптацию стека ПО, оптимизацию операторов и оркестрацию кластера. Параллельно крупные модельные компании переходят от продажи API по числу вызовов к модели разделения выручки с облачными провайдерами, что структурно увеличивает суммарное потребление вычислительных ресурсов.
В сентябре 2026 года Министерство промышленности и информационных технологий КНР официально закрепило курс на развёртывание кластеров от 10 000 до 100 000 GPU с приоритетом китайских чипов. Inspur входит в число вендоров, уже поставляющих такие кластеры на базе китайских GPU головным облачным провайдерам страны.
Источник: TMTPost (🇨🇳)
#Huawei #Inspur #AlibabaCloud #Суперузел #SD200Ultra #ИИ #инфраструктура
Post #2988
5