توی بنچمارکهای رسمی برای کارهای ایجنتیک، برنامهنویسی و کنترل سیستم نمرات بالایی ثبت کرده (مثل شاخص ۵۲ در ارزیابی مستقل Artificial Analysis). اما در استفاده واقعی یک ضعف مشخص داره: تمایل به تفکر بیشازحد یا همون Overthinking. اگر متغیر تلاش تفکر یعنی
reasoning_effort رو روی حالت متوسط یا کم تنظیم نکنید، برای سوالهای ساده توکنهای بسیار زیادی میسوزونه و خروجی کند میشه.واقعیت اجرای مدل روی سیستمها و کارتهای مختلف:
کارتهای ۲۴ گیگابایت (مثل 3090 یا 4090):
نقطه تعادل مدل نسخه ۴ بیتی مثل
Q4_K_M با حجم حدود ۱۷ گیگابایته. روی این کارتها به راحتی اجرا میشه و فضای کافی برای کانتکست ۳۲ تا ۶۴ هزار توکنی باقی میمونه.کارتهای ۱۶ گیگابایت (مثل 5080 لپتاپ یا 4060Ti):
نسخه ۴ بیتی کامل جا نمیشه. باید برید سراغ کوانت ۳ بیتی مثل
UD-Q3_K_XL (حدود ۱۳.۵ گیگابایت) و برای مصرف کمتر حافظه، کش کانتکست رو هم ۴ بیتی کنید (--cache-type-k q4_0). سرعت بین ۲۰ تا ۵۰ توکن بر ثانیه میده و برای کدنویسی واقعی جوابه.کارتهای زیر ۱۲ گیگابایت یا ۶ گیگ (مثل 3050):
اجرای مدل عملاً منطقی نیست. نسخههای ۱ یا ۲ بیتی بالا میان ولی افت کیفیت در منطق و برنامهنویسی بسیار شدیده و سرعت با فرستادن لایهها روی پردازنده اصلی به زیر ۲ توکن بر ثانیه میرسه.
وضعیت روی سیستمهای مک و حافظه یکپارچه:
- مکهای ۱۶ گیگابایت: به خاطر اشغال رم توسط سیستمعامل، فقط کوانتهای خیلی ضعیف ۲ بیتی جا میشن که خروجی بیکیفیت و کندی دارن.
- مک ۲۴ گیگابایت (مثل M2 یا پایه M5 Pro): با کوانت ۳ بیتی یا ۴ بیتی هماهنگ کار میکنه و سرعت حدود ۸ تا ۱۵ توکن بر ثانیه میده.
- مکهای ۳۶ گیگابایت به بالا (مثل M3 Pro یا M5 Pro): محیط ایدهآل اجرای روان نسخه ۴ بیتی با فریمورک MLX و سرعت بالای ۲۰ توکن بر ثانیه است.
برای گرفتن بالاترین سرعت روی تمام سیستمها، مدل دارای یک head داخلی برای حدس کلمات بعدی یا همون Multi-Token Prediction هست. با فعال کردن پیشبینی کمکی (Speculative Decoding)، سرعت پردازش کلمات بین ۳۰ تا ۱۰۰ درصد بدون افت دقت بالا میره.
برای اجرا با Llama.cpp server روی GPU یتونید از دستور بهینهشده زیر استفاده کنید:
llama-server -m Qwen3.8-27B-UD-Q3_K_XL.gguf -c 32768 -ngl 99 -fa on --jinja --cache-type-k q4_0 --cache-type-v q4_0 --spec-type draft-mtp --spec-draft-n-max 2سادهترین روش برای شروع سریع هم استفاده از LMstudio یا Ollama با اجرای دستور
ollama run qwen3.8:27b در سیستمهای عادی و فلگ qwen3.8:27b-mlx برای سیستمهای اپل سیلیکون هست.https://unsloth.ai/docs/models/qwen3.8
🛠 Join @LLMEngineers Community