TGViewer
Linuxor ? Linuxor ? @linuxor · 31.7K subscribers
Post #5314 9.21K
چطور یه مدل 35B رو روی RTX 3060 با 12GB VRAM اجرا کنیم؟

با ترکیب Q4_K_M + MoE CPU offloading میشه مدل Qwen3.8-35B-A3B رو روی یه RTX 3060 اجرا کرد.

کل 262K کانتکست رو هم استفاده می‌کنه. سرعت decode حدود 50 توکن بر ثانیه هستش و سرعت prefill حدود 550 توکن بر ثانیه.

کانفیگ:
llama-server
-m Qwen3.8-35B-A3B-Q4_K_M.gguf
-ngl 99 --n-cpu-moe 26 -c 262144 -fa on --jinja
-np 1
--cache-type-k q8_0 --cache-type-v q8_0
--temp 0.6 --top-p 0.95 --top-k 20
--reasoning on


@Linuxor
More from @linuxor
  1. Sep 28, 2026دکمه‌ی Turbo روی کیس‌های قدیمی یکی از چیزهای جالب کامپیوترهای دهه‌های 1980 و 1990 بود. توی…
  2. Sep 28, 2026آموزش گام به گام اجرای مدل‌های Laya Decision رو به‌صورت لوکال و فقط با 4GB رم روی CPU، مک،…
  3. Sep 28, 2026تقریبا همه بازی های ساخته شده هوش مصنوعی که روی وب کار میکنن از Three.js استفاده میکنن اما…
  4. Sep 28, 2026این ویدیو هم جالب بود روی گوشی S26 مدل تصمیم گیر شبیه Jev به اسم Laya-LiteRT رو ران میکنه…
  5. Sep 28, 2026فروش Gemini Pro و Super Duolingo فقط 480 هزار تومن به مدت ۴۸ ساعت. 🛒 جهت ثبت سفارش: @AccA…
  6. Sep 28, 2026اگر سایت یا اپی دارید که داخلش دارید از چارت های مختلفی استفاده میکنید این دو تا سایت به د…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →