TGViewer
Вездесущий ИИ | Лучшие нейросети Вездесущий ИИ | Лучшие нейросети @ii_papka · 2.7K subscribers
Post #1006 643
🔗 Несколько DGX Spark — как запустить одну модель по частям

Большую модель можно распределить между несколькими компьютерами


Каждый хранит свою часть весов, выполняет расчёты и обменивается промежуточными результатами с соседями

Это называется распределённый инференс

Пользователь отправляет один запрос и получает один ответ

Как именно режут модель?

— Pipeline parallelism — по слоям
Условно: первая машина считает слои 1–40, вторая — 41–80. Промежуточные данные проходят по цепочке

Запрос → Spark №1: первые слои → Spark №2: следующие слои → следующий токен

Для одиночного запроса часть оборудования может ждать свою очередь

— Tensor parallelism — внутри слоёв
Большие матричные операции делят между устройствами. Они считают свои части параллельно и регулярно объединяют результаты

— Expert parallelism — по экспертам MoE
Экспертов размещают на разных устройствах, а данные направляют к выбранным экспертам. Нужна поддержка конкретной модели и движка

Эти способы можно сочетать — документация vLLM

Память складывается с оговорками
Два Spark — суммарно 256 ГБ, четыре — 512 ГБ. Но память остаётся распределённой: программа должна явно разложить модель, а часть объёма уйдёт под систему, кеш и рабочие буферы

При цене 490 тысяч ₽ за коробку получаем 980 тысяч за две или 1,96 млн за четыре

Как собрать рабочую связку
Соединить устройства через ConnectX-7

Для двух Spark — прямой QSFP-кабель с поддержкой нужного соединения. В официальной схеме для трёх можно использовать кольцо из трёх кабелей, для четырёх нужен совместимый QSFP-коммутатор

Обновить системы и добавить их в NVIDIA Sync
Запустить Cluster Assistant: он помогает настроить сеть, межузловой SSH и проверить соединение

Мастер поддерживает 2–4 устройства — схемы и настройка NVIDIA

Где подвох?
Соединение 200 Гбит/с — теоретически 25 ГБ/с до накладных расходов

Внутренняя память одного Spark — 273 ГБ/с

Поэтому частый обмен между коробками способен стать ограничением — спецификации NVIDIA

Два Spark не обещают двойную скорость

Главная выгода — возможность разместить более крупную модель или обслуживать больше работы

= скорее всего будет МЕДЛЕННО, упирается все в соединительные кабели (поэтому м3 ультра на 512 сильно круче по этим параметрами)

👍 — теперь понял, как делят модель

🪐 Вездесущий ИИ | Чат с админом | Консультация
More from @ii_papka
  1. Sep 24, 2026🥾 Разгоняем тяжелую модель в 2–2.5 раза через спекулятивный декодинг Берем основную рабоч…
  2. Sep 24, 2026Сидите на бесплатной версии AI и думаете, что вам хватит? Проверьте себя по четырём пункта…
  3. Sep 23, 2026⚡️ Как ускорить локальный ИИ в 2–3 раза без покупки новой видеокарты Стандартный GGUF — ме…
  4. Sep 22, 2026🐈 Нейроморфные процессоры — Loihi от Intel Labs. Что это за демон? АРХИТЕКТУРА СЕЙЧАС ⬇️…
  5. Sep 21, 2026💻 Codex Remote — лучшая фича за последние годы Оставил ноут / комп включенным, подключил…
  6. Sep 20, 2026🧑‍🎓 Рассматриваешь курс по ИИ? Это какой-то бред ... Зачем тратить деньги на то, что дос…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →