Большую модель можно распределить между несколькими компьютерами
Каждый хранит свою часть весов, выполняет расчёты и обменивается промежуточными результатами с соседями
Это называется распределённый инференс
Пользователь отправляет один запрос и получает один ответ
Как именно режут модель?
— Pipeline parallelism — по слоям
Условно: первая машина считает слои 1–40, вторая — 41–80. Промежуточные данные проходят по цепочке
Запрос → Spark №1: первые слои → Spark №2: следующие слои → следующий токенДля одиночного запроса часть оборудования может ждать свою очередь
— Tensor parallelism — внутри слоёв
Большие матричные операции делят между устройствами. Они считают свои части параллельно и регулярно объединяют результаты
— Expert parallelism — по экспертам MoE
Экспертов размещают на разных устройствах, а данные направляют к выбранным экспертам. Нужна поддержка конкретной модели и движка
Эти способы можно сочетать — документация vLLM
Память складывается с оговорками
Два Spark — суммарно 256 ГБ, четыре — 512 ГБ. Но память остаётся распределённой: программа должна явно разложить модель, а часть объёма уйдёт под систему, кеш и рабочие буферы
При цене 490 тысяч ₽ за коробку получаем 980 тысяч за две или 1,96 млн за четыре
Как собрать рабочую связку
Соединить устройства через ConnectX-7
Для двух Spark — прямой QSFP-кабель с поддержкой нужного соединения. В официальной схеме для трёх можно использовать кольцо из трёх кабелей, для четырёх нужен совместимый QSFP-коммутатор
Обновить системы и добавить их в NVIDIA Sync
Запустить Cluster Assistant: он помогает настроить сеть, межузловой SSH и проверить соединение
Мастер поддерживает 2–4 устройства — схемы и настройка NVIDIA
Где подвох?
Соединение 200 Гбит/с — теоретически 25 ГБ/с до накладных расходов
Внутренняя память одного Spark — 273 ГБ/с
Поэтому частый обмен между коробками способен стать ограничением — спецификации NVIDIA
Два Spark не обещают двойную скорость
Главная выгода — возможность разместить более крупную модель или обслуживать больше работы
= скорее всего будет МЕДЛЕННО, упирается все в соединительные кабели (поэтому м3 ультра на 512 сильно круче по этим параметрами)
👍 — теперь понял, как делят модель
🪐 Вездесущий ИИ | Чат с админом | Консультация
