В моем сетапе (2x5060Ti=32Gb VRAM) сейчас используется технология Tensor Parallelism. Это когда моделька работает сразу на двух RTX 5060 Ti 16 ГБ через vLLM.
Веса каждого слоя и KV-кэш делятся между GPU. Обе карты параллельно считают один и тот же слой, затем синхронизируют промежуточные результаты. Из-за этого модель, которой не хватило бы памяти одной карты, помещается в суммарные 32 ГБ VRAM.
Плюсы Tensor Parallelism:
• модель 35B влезает в две 16-ГБ карты
• обычно ниже задержка и выше скорость генерации одного ответа, чем при последовательной обработке слоёв
• доступны оптимизации vLLM: NVFP4 (имба, квантизация от nvidia, специально под 50xx), FP8 KV-cache, prefix cache, MTP, tool calling и reasoning parser.
Но есть нюанс: у меня "древняя" материнка, у нее один PCI x16, а второй x4. Обмен по второму PCI идёт через CPU host bridge. Поэтому на каждом слое есть накладные расходы на синхронизацию - две GPU не превращаются автоматически в одну карту вдвое быстрее.
Альтернатива - Pipeline Parallelism (PP). В этом режиме первая часть слоёв находится на первой GPU, вторая - на второй. Между картами передаются данные только на границе этапов, а не внутри каждого слоя.
PP полезен при слабом меж-GPU соединении или для трёх и более карт, когда Tensor Parallelism технически не подходит. Но для одного диалога он часто медленнее: второй GPU ждёт, пока первый обработает свою часть токена. PP раскрывается при нескольких параллельных запросах, когда конвейер постоянно заполнен.
Есть и другие режимы:
• Data Parallelism: полная копия модели на каждой карте для обслуживания разных пользователей; одному запросу не помогает.
• Expert Parallelism: распределение экспертов MoE-моделей между GPU; перспективно для Qwen3.6-35B-A3B, но на PCIe требует отдельных тестов.
• llama.cpp: умеет распределять слои или тензоры между GPU и выгоден для GGUF-квантизаций и CPU-offload
Вывод: для двух RTX 5060 Ti и одной активной Opencode-сессии (на нем построен мой харнесс) "vLLM + TP=2" оптимальный баланс.
У меня появилась даже безумная идея поставить третью видеокарту. Есть внешние egpu блоки (озон за 138к тенге), в них можно воткнуть видюху, а к ним можно подключиться по Oculink или ЮСБ4. ЮСБ4 ну слишком медленный (5 Гб/с), а окулинка разьемов на матплатах нету. Но оказывается можно дешево взять переходник м2-окулинк, и через него подключить внешнюю видюху. Короче, надо думать. Щас пользуюсь активно моделькой Qwen3.6-35B-A3B-NVFP4, на двух видюхах влезает она + 128к контекста.
Post #3051
1.47K
Order of Six Angles Photo