TGViewer
Order of Six Angles Order of Six Angles @orderofsixangles · 5.37K subscribers
Post #3051 1.47K
Order of Six Angles Photo
В моем сетапе (2x5060Ti=32Gb VRAM) сейчас используется технология Tensor Parallelism. Это когда моделька работает сразу на двух RTX 5060 Ti 16 ГБ через vLLM.

Веса каждого слоя и KV-кэш делятся между GPU. Обе карты параллельно считают один и тот же слой, затем синхронизируют промежуточные результаты. Из-за этого модель, которой не хватило бы памяти одной карты, помещается в суммарные 32 ГБ VRAM.

Плюсы Tensor Parallelism:

• модель 35B влезает в две 16-ГБ карты
• обычно ниже задержка и выше скорость генерации одного ответа, чем при последовательной обработке слоёв
• доступны оптимизации vLLM: NVFP4 (имба, квантизация от nvidia, специально под 50xx), FP8 KV-cache, prefix cache, MTP, tool calling и reasoning parser.

Но есть нюанс: у меня "древняя" материнка, у нее один PCI x16, а второй x4. Обмен по второму PCI идёт через CPU host bridge. Поэтому на каждом слое есть накладные расходы на синхронизацию - две GPU не превращаются автоматически в одну карту вдвое быстрее.

Альтернатива - Pipeline Parallelism (PP). В этом режиме первая часть слоёв находится на первой GPU, вторая - на второй. Между картами передаются данные только на границе этапов, а не внутри каждого слоя.

PP полезен при слабом меж-GPU соединении или для трёх и более карт, когда Tensor Parallelism технически не подходит. Но для одного диалога он часто медленнее: второй GPU ждёт, пока первый обработает свою часть токена. PP раскрывается при нескольких параллельных запросах, когда конвейер постоянно заполнен.

Есть и другие режимы:

• Data Parallelism: полная копия модели на каждой карте для обслуживания разных пользователей; одному запросу не помогает.
• Expert Parallelism: распределение экспертов MoE-моделей между GPU; перспективно для Qwen3.6-35B-A3B, но на PCIe требует отдельных тестов.
• llama.cpp: умеет распределять слои или тензоры между GPU и выгоден для GGUF-квантизаций и CPU-offload

Вывод: для двух RTX 5060 Ti и одной активной Opencode-сессии (на нем построен мой харнесс) "vLLM + TP=2" оптимальный баланс.

У меня появилась даже безумная идея поставить третью видеокарту. Есть внешние egpu блоки (озон за 138к тенге), в них можно воткнуть видюху, а к ним можно подключиться по Oculink или ЮСБ4. ЮСБ4 ну слишком медленный (5 Гб/с), а окулинка разьемов на матплатах нету. Но оказывается можно дешево взять переходник м2-окулинк, и через него подключить внешнюю видюху. Короче, надо думать. Щас пользуюсь активно моделькой Qwen3.6-35B-A3B-NVFP4, на двух видюхах влезает она + 128к контекста.
More from @orderofsixangles
  1. Sep 23, 2026Короче поставил себе GrokBot. Будем изучать, что за зверь такой
  2. Sep 22, 2026Windows Exploitation Techniques: Dangling COM Object Registrations https://projectzero.goo…
  3. Sep 22, 2026анонс на Apsara Conference 2026. Alibaba заявила, что сейчас тренирует следующее поколение…
  4. Sep 22, 2026спустя 6 лет обновил тулзу свою https://github.com/thatskriptkid/apk-infector-Archinome/tr…
  5. Sep 21, 2026Working, tested code for every chapter of the book The Art of Exploit Development: Vulnera…
  6. Sep 21, 2026Android 1-day exploit by LLM (GLM-5.3) 15 числа вышло сентябрьское обновление безопасности…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →