35B-модель на RTX 5080 и RTX 3060: 109 ток/с через PCIe Gen2 x4 #habr
https://habr.com/ru/articles/1088316/
Tags: llama.cpp, локальные llm, moe, gguf, инференс llm, vram использование, pcie, qwen3.6, Qwen 3.6, локальный ии
Author: aigen31
Post #323504
35