تحلیل معماری Qwen 3.5: خداحافظی با Brute-Force Scaling
تیم Qwen با سری ۳.۵ نشون داد که دوران صرفاً اضافه کردن لایه و پارامتر تموم شده. زیر کاپوت این مدلها تغییرات معماری سنگینی اتفاق افتاده که باعث شده مدل ۳۵ میلیاردی (با ۳ میلیارد پارامتر فعال) بتونه مدل ۲۳۵ میلیاردی نسل قبل رو توی جیبش بذاره. بیاید فنی بررسی کنیم.
نوآوری در معماری: Hybrid Attention
معماری این مدلها دیگه Pure Transformer کلاسیک نیست. از ترکیب Gated DeltaNet و Gated Attention استفاده کردن.
بلوکها به صورت ترکیبی چیده شدن (مثلاً توی 35B، پترن به صورت ۳ تا DeltaNet و بعد ۱ دونه Attention تکرار میشه).
اینکار باعث میشه سربار حافظه (KV Cache) توی Contextهای طولانی به شدت کاهش پیدا کنه و Throughput و درنتیجه سرعت پاسخگویی بره بالا، بدون اینکه دقت مدل توی Retrieval افت کنه.
مکانیزم Mixture-of-Experts (MoE)
در مدلهای 35B و 122B از ۲۵۶ اکسپرت استفاده شده که برای هر توکن، ۸ اکسپرت روتینگ میشن + ۱ اکسپرت اشتراکی.
این یعنی Sparsity بسیار بالا. توی مدل 122B عملاً دارید با هزینه محاسباتی یه مدل ۱۰ میلیاردی، خروجی یه مدل ۱۰۰+ میلیاردی میگیرید. برخلاف مدلهای قبلی مثل Next-80B، اینجا Routing بسیار هوشمندتر شده و Expertها تخصصیتر عمل میکنن.
قابلیت Multi-token Prediction (MTP)
مدل آموزش دیده که چند توکن آینده رو پیشبینی کنه، نه فقط یکی. این تکنیک هم سرعت Inference رو بالا میبره و هم توانایی Reasoning رو تقویت میکنه چون مدل مجبور میشه "جلوتر" رو ببینه.
پایپلاین آموزشی: RL روی میلیونها ایجنت
برخلاف روشهای سنتی SFT، اینجا تمرکز روی RL مقیاسپذیر بوده. مدلها توی محیطهای شبیهسازی شده با میلیونها ایجنت تعامل کردن.
این یعنی توانایی Tool Use، پلنچینی و Search توی این مدلها "حفظیات" نیست، بلکه حاصل تعامل توی محیطهای پیچیده است. به همین دلیله که توی بنچمارکهایی مثل BFCL و Tool-Use، مدلهای Closed Source رو اذیت میکنن.
ویژن و Multimodal
از تکنیک Early-fusion استفاده شده. دیگه Vision Encoder جدا نیست که به مدل متنی چسبونده باشن؛ توکنهای تصویری و ویدیویی از لایههای ابتدایی با متن ترکیب میشن. نتیجهش میشه درک Native از ویدیو و تصاویر بدون از دست دادن جزئیات.
نکات دیپلوی (Production Notes):
برای پرفرمنس ماکزیمم، حتماً از SGLang یا vLLM استفاده کنید چون معماری Hybrid Attention و MTP رو کامل ساپورت میکنن.
برای Thinking Mode، دمای (Temperature) رو روی ۱.۰ و top_p رو روی ۰.۹۵ بذارید.
نسخههای GGUF (مثل IQ4_XS) روی سختافزارهای محدود عملکرد پایداری دارن و Quality Degradation کمی نشون دادن.
به نظر من این سری، تعریف جدیدی از Efficiency Frontier هست و نشون میده که بهینهسازی معماری و کیفیت دیتا، خیلی مهمتر از تعداد پارامتر خام هست.
📃 داکیومنت فنی و بنچمارکها:
https://qwenlm.github.io/blog/qwen3.5-medium/
🛠 Join @LLMEngineers Community
Post #316
2.09K
- ❤ 7