مدل Qwen3.5-397B-A17B که همین چند ساعت پیش آپدیت شد، یه قدرتنمایی توی مهندسی زیرساخته و نشون میده تیم توسعهدهنده کاملاً با چالشهای عملیاتی درگیر بوده. این مدل با ۳۹۷ میلیارد پارامتر کل و فقط ۱۷ میلیارد پارامتر فعال، عملاً داره مرزهای کارایی MoE رو جابهجا میکنه. چیزی که اینجا مهمه، معماری ترکیبی Gated DeltaNet و Gated Attention هست که در کنار MoE قرار گرفته. استفاده از DeltaNet که یه نوع Linear Attention بهینه هست، باعث میشه توی Context پنجرههای طولانی، گلوگاههای محاسباتی معمول رو نداشته باشیم.
تکنیک MTP یا Multi-token Prediction که به صورت Multi-steps پیادهسازی شده، یکی از نقاط قوت این مدل برای افزایش سرعت استنتاج و کیفیت خروجی در گامهای بلنده. با ۵۱۲ اکسپرت که ۱۰ تاشون مسیریابی میشن و ۱ دونهشون اشتراکیه، تعادل خوبی بین تخصصگرایی مدل و حفظ دانش عمومی برقرار شده. این چیدمان باعث میشه مدل توی کارهای پیچیده مثل استدلالهای چند مرحلهای، دقت بالاتری نسبت به MoEهای کلاسیک داشته باشه.
پشتیبانی از ۲۶۲ هزار توکن Context به صورت Native و قابلیت گسترش تا بیش از ۱ میلیون توکن با YaRN، این مدل رو برای پردازش داکیومنتهای حجیم بیرقیب میکنه. نکته مهندسی و جذاب ماجرا اینجاست که توی مستندات، آپشن Language-model-only رو گذاشتن. این یعنی میتونید بخشهای بینایی (Multimodal) رو موقع سرو کردن غیرفعال کنید تا KV Cache آزاد بشه و بتونید از حداکثر ظرفیت Context بدون کرش کردن کارت گرافیک استفاده کنید. این دقیقاً همون دیدگاه سینیوری هست که برای محیط Production لازمه؛ حذف اضافات برای گرفتن پرفورمنس ماکسیمم.
واقعیت اینه که Qwen3.5 ثابت کرد برای داشتن Context یک میلیونی، نباید فقط به سختافزار تکیه کرد؛ بلکه باید معماری رو طوری دستکاری کرد که "هوشمندانه" از حافظه استفاده کنه. قابلیت نادیده گرفتن کامپوننتهای Vision موقع استنتاج متنی، چیزیه که باید خیلی زودتر توی مدلهای مولتیمودال میدیدیم.
📃 مخزن مدل در هاگینگ فیس:
https://huggingface.co/Qwen/Qwen3.5-397B-A17B
🛠 Join @LLMEngineers Community
Post #298
1.23K
- ❤ 6
- 🔥 2
- 👍 1