Я решил сделать тесты. Во-первых, у моей платы
верхний PCI_E1 — линии CPU, PCIe 4.0 x16;
нижний PCI_E3 — от чипсета B550, физически x16, но электрически только PCIe 3.0 x4.
То есть, у меня нижний слот в материнке вообще третья версия. И не смотря на это, тензорное распределение оказалось лучше.
Post #3052
1.28K
Order of Six Angles В моем сетапе (2x5060Ti=32Gb VRAM) сейчас используется технология Tensor Parallelism. Это когда моделька работает сразу на двух RTX 5060 Ti 16 ГБ через vLLM. Веса каждого слоя и KV-кэш делятся между GPU. Обе карты параллельно считают один и тот же слой, затем…
