چطور یه مدل 35B رو روی RTX 3060 با 12GB VRAM اجرا کنیم؟
با ترکیب Q4_K_M + MoE CPU offloading میشه مدل Qwen3.8-35B-A3B رو روی یه RTX 3060 اجرا کرد.
کل 262K کانتکست رو هم استفاده میکنه. سرعت decode حدود 50 توکن بر ثانیه هستش و سرعت prefill حدود 550 توکن بر ثانیه.
کانفیگ:
llama-server
-m Qwen3.8-35B-A3B-Q4_K_M.gguf
-ngl 99 --n-cpu-moe 26 -c 262144 -fa on --jinja
-np 1
--cache-type-k q8_0 --cache-type-v q8_0
--temp 0.6 --top-p 0.95 --top-k 20
--reasoning on
@Linuxor
Post #5314
9.21K