TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #316 2.09K
تحلیل معماری Qwen 3.5: خداحافظی با Brute-Force Scaling

تیم Qwen با سری ۳.۵ نشون داد که دوران صرفاً اضافه کردن لایه و پارامتر تموم شده. زیر کاپوت این مدل‌ها تغییرات معماری سنگینی اتفاق افتاده که باعث شده مدل ۳۵ میلیاردی (با ۳ میلیارد پارامتر فعال) بتونه مدل ۲۳۵ میلیاردی نسل قبل رو توی جیبش بذاره. بیاید فنی بررسی کنیم.

نوآوری در معماری: Hybrid Attention
معماری این مدل‌ها دیگه Pure Transformer کلاسیک نیست. از ترکیب Gated DeltaNet و Gated Attention استفاده کردن.
بلوک‌ها به صورت ترکیبی چیده شدن (مثلاً توی 35B، پترن به صورت ۳ تا DeltaNet و بعد ۱ دونه Attention تکرار میشه).
اینکار باعث میشه سربار حافظه (KV Cache) توی Contextهای طولانی به شدت کاهش پیدا کنه و Throughput و درنتیجه سرعت پاسخگویی بره بالا، بدون اینکه دقت مدل توی Retrieval افت کنه.

مکانیزم Mixture-of-Experts (MoE)
در مدل‌های 35B و 122B از ۲۵۶ اکسپرت استفاده شده که برای هر توکن، ۸ اکسپرت روتینگ میشن + ۱ اکسپرت اشتراکی.
این یعنی Sparsity بسیار بالا. توی مدل 122B عملاً دارید با هزینه محاسباتی یه مدل ۱۰ میلیاردی، خروجی یه مدل ۱۰۰+ میلیاردی می‌گیرید. برخلاف مدل‌های قبلی مثل Next-80B، اینجا Routing بسیار هوشمندتر شده و Expertها تخصصی‌تر عمل می‌کنن.

قابلیت Multi-token Prediction (MTP)
مدل آموزش دیده که چند توکن آینده رو پیش‌بینی کنه، نه فقط یکی. این تکنیک هم سرعت Inference رو بالا میبره و هم توانایی Reasoning رو تقویت می‌کنه چون مدل مجبور میشه "جلوتر" رو ببینه.

پایپ‌لاین آموزشی: RL روی میلیون‌ها ایجنت
برخلاف روش‌های سنتی SFT، اینجا تمرکز روی RL مقیاس‌‌پذیر بوده. مدل‌ها توی محیط‌های شبیه‌سازی شده با میلیون‌ها ایجنت تعامل کردن.
این یعنی توانایی Tool Use، پلن‌چینی و Search توی این مدل‌ها "حفظیات" نیست، بلکه حاصل تعامل توی محیط‌های پیچیده است. به همین دلیله که توی بنچمارک‌هایی مثل BFCL و Tool-Use، مدل‌های Closed Source رو اذیت می‌کنن.

ویژن و Multimodal
از تکنیک Early-fusion استفاده شده. دیگه Vision Encoder جدا نیست که به مدل متنی چسبونده باشن؛ توکن‌های تصویری و ویدیویی از لایه‌های ابتدایی با متن ترکیب میشن. نتیجه‌ش میشه درک Native از ویدیو و تصاویر بدون از دست دادن جزئیات.

نکات دیپلوی (Production Notes):
برای پرفرمنس ماکزیمم، حتماً از SGLang یا vLLM استفاده کنید چون معماری Hybrid Attention و MTP رو کامل ساپورت می‌کنن.
برای Thinking Mode، دمای (Temperature) رو روی ۱.۰ و top_p رو روی ۰.۹۵ بذارید.
نسخه‌های GGUF (مثل IQ4_XS) روی سخت‌افزارهای محدود عملکرد پایداری دارن و Quality Degradation کمی نشون دادن.

به نظر من این سری، تعریف جدیدی از Efficiency Frontier هست و نشون میده که بهینه‌سازی معماری و کیفیت دیتا، خیلی مهم‌تر از تعداد پارامتر خام هست.

📃 داکیومنت فنی و بنچمارک‌ها:
https://qwenlm.github.io/blog/qwen3.5-medium/

🛠 Join @LLMEngineers Community
  • ❤ 7
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →