TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #488 2.21K
AI Engineers INCREDIBLE Qwen 3.8 27B scored 51 on the Artificial Analysis Agentic Index Ahead of GLM 5.2 and DeepSeek V4 Pro 0813 Only behind a few SoTA models several to tens of times its size Runs on ~2-3k USD hardware btw Permanent underclass is officially cancelled
معماری مدل Qwen3.8-27B ترکیبی ساخته شده؛ یعنی از ۶۴ لایه، فقط ۱۶ لایه‌اش به سبک کلاسیک توجه کامل دارند و ۴۸ لایه دیگه به‌صورت خطی (با معماری Gated DeltaNet) کار می‌کنند. این طراحی باعث شده حافظه موقت پردازش متن یا همون KV Cache بسیار سبک‌تر از مدل‌های عادی باشه و کانتکست ۲۶۲ هزار توکنی مدل روی سیستم‌های خانگی رم زیادی مصرف نکنه.

توی بنچمارک‌های رسمی برای کارهای ایجنتیک، برنامه‌نویسی و کنترل سیستم نمرات بالایی ثبت کرده (مثل شاخص ۵۲ در ارزیابی مستقل Artificial Analysis). اما در استفاده واقعی یک ضعف مشخص داره: تمایل به تفکر بیش‌ازحد یا همون Overthinking. اگر متغیر تلاش تفکر یعنی reasoning_effort رو روی حالت متوسط یا کم تنظیم نکنید، برای سوال‌های ساده توکن‌های بسیار زیادی می‌سوزونه و خروجی کند می‌شه.

واقعیت اجرای مدل روی سیستم‌ها و کارت‌های مختلف:

کارت‌های ۲۴ گیگابایت (مثل 3090 یا 4090):
نقطه تعادل مدل نسخه ۴ بیتی مثل Q4_K_M با حجم حدود ۱۷ گیگابایته. روی این کارت‌ها به راحتی اجرا می‌شه و فضای کافی برای کانتکست ۳۲ تا ۶۴ هزار توکنی باقی می‌مونه.

کارت‌های ۱۶ گیگابایت (مثل 5080 لپ‌تاپ یا 4060Ti):
نسخه ۴ بیتی کامل جا نمی‌شه. باید برید سراغ کوانت ۳ بیتی مثل UD-Q3_K_XL (حدود ۱۳.۵ گیگابایت) و برای مصرف کمتر حافظه، کش کانتکست رو هم ۴ بیتی کنید (--cache-type-k q4_0). سرعت بین ۲۰ تا ۵۰ توکن بر ثانیه میده و برای کدنویسی واقعی جوابه.

کارت‌های زیر ۱۲ گیگابایت یا ۶ گیگ (مثل 3050):
اجرای مدل عملاً منطقی نیست. نسخه‌های ۱ یا ۲ بیتی بالا میان ولی افت کیفیت در منطق و برنامه‌نویسی بسیار شدیده و سرعت با فرستادن لایه‌ها روی پردازنده اصلی به زیر ۲ توکن بر ثانیه می‌رسه.

وضعیت روی سیستم‌های مک و حافظه یکپارچه:
- مک‌های ۱۶ گیگابایت: به خاطر اشغال رم توسط سیستم‌عامل، فقط کوانت‌های خیلی ضعیف ۲ بیتی جا می‌شن که خروجی بی‌کیفیت و کندی دارن.
- مک ۲۴ گیگابایت (مثل M2 یا پایه M5 Pro): با کوانت ۳ بیتی یا ۴ بیتی هماهنگ کار می‌کنه و سرعت حدود ۸ تا ۱۵ توکن بر ثانیه می‌ده.
- مک‌های ۳۶ گیگابایت به بالا (مثل M3 Pro یا M5 Pro): محیط ایده‌آل اجرای روان نسخه ۴ بیتی با فریم‌ورک MLX و سرعت بالای ۲۰ توکن بر ثانیه است.

برای گرفتن بالاترین سرعت روی تمام سیستم‌ها، مدل دارای یک head داخلی برای حدس کلمات بعدی یا همون Multi-Token Prediction هست. با فعال کردن پیش‌بینی کمکی (Speculative Decoding)، سرعت پردازش کلمات بین ۳۰ تا ۱۰۰ درصد بدون افت دقت بالا می‌ره.

برای اجرا با Llama.cpp server روی GPU ی‌تونید از دستور بهینه‌شده زیر استفاده کنید:
llama-server -m Qwen3.8-27B-UD-Q3_K_XL.gguf -c 32768 -ngl 99 -fa on --jinja --cache-type-k q4_0 --cache-type-v q4_0 --spec-type draft-mtp --spec-draft-n-max 2

ساده‌ترین روش برای شروع سریع هم استفاده از LMstudio یا Ollama با اجرای دستور ollama run qwen3.8:27b در سیستم‌های عادی و فلگ qwen3.8:27b-mlx برای سیستم‌های اپل سیلیکون هست.

https://unsloth.ai/docs/models/qwen3.8

🛠 Join @LLMEngineers Community
unsloth.ai Qwen3.8 - How to Run Locally | Unsloth Documentation Guide to running Qwen3.8 quants including Qwen3.8-27B on your local setup.
  • 👍 6
  • 🔥 2
  • ❤ 1
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →