نقشه راه هوش مصنوعی در ابتدای سال ۲۰۲۶ از "تئوریهای معماری" فاصله گرفته و کاملاً وارد قلمرو "مهندسی سیستم" شده. مدلهای جدید مثل Qwen3.5 و GLM-5 نشون دادن که جنگِ پارامترها جای خودش رو به جنگِ نرخ توکن (Throughput) و مدیریت حافظه داده. واقعیت اینه که داشتن یه مدل ۷۴۴ میلیاردی بدون زیرساخت استنتاج بهینه، عملاً بیاستفادهست.
معماری Sparse MoE حالا دیگه انتخاب اول برای اسکیل کردن مدلهاست. مدل Qwen3.5 با ۳۹۷ میلیارد پارامتر که فقط ۱۷ میلیاردش فعاله، ثابت کرد که میشه با ۵۱۲ اکسپرت به دقت مدلهای متراکم رسید ولی با هزینهای بسیار کمتر. استفاده از Gated Delta Networks و Hybrid Linear Attention توی این مدلها، مشکل همیشگی حافظه در کانتکستهای طولانی رو حل کرده. به نظر من، نکته طلایی این انتشارها Multi-Token Prediction (MTP) هست؛ تکنیکی که اجازه میده مدل در هر گام چندین توکن رو پیشبینی کنه و سرعت استنتاج رو تا ۱۹ برابر بالا ببره. این یعنی ایجنتهای هوشمند دیگه نباید ثانیهها منتظر جواب بمونن.
زیرساخت Slime نشون داد که RL (یادگیری تقویتشده) از یه مرحله فرعی در پسآموزش، به یه "سیستم توزیعشده سنگین" تبدیل شده. جدا کردن بخش تولید داده (Rollout) از بخش آموزش (Training) در Slime، اجازه میده که مدلهای MoE غولآسا با پایداری بالا تیون بشن. این یعنی ما دیگه دنبال معماری جدید نیستیم، بلکه دنبال پایپلاینهای RL پایدارتری هستیم که بتونن رفتار ایجنت رو در سناریوهای طولانی اصلاح کنن.
صوت و OCR هم دارن به سمت "نیتیو" شدن حرکت میکنن. مدلهایی مثل Voxtral Realtime و Nemotron نشون دادن که دوران تکهتکه کردن صوت (Chunking) تموم شده. ما الان مدلهای ASR با تاخیر زیر ۵۰۰ میلیثانیه داریم که مستقیماً با انکودرهای علّی (Causal) آموزش دیدن. در بخش OCR هم مدل LightOnOCR ثابت کرد که دیدگاه VLM (مدل بینایی-زبانی) برای فهم اسناد، بسیار برتر از پایپلاینهای قدیمی تشخیص و بازشناسیه. تبدیل مستقیم تصویر سند به Markdown تمیز، حالا دیگه یک مسئله حل شدهست.
تولید ویدیو هم با تکنیک QVG و کوانتیزاسیون ۲ بیتی KV-cache وارد فاز عملیاتی شده. وقتی میتونید مصرف حافظه رو ۷ برابر کم کنید بدون اینکه کیفیت ویدیو نابود بشه، یعنی امکان اجرای مدلهای جهان (World Models) روی کارتهای گرافیک معمولی فراهم شده. به نظر من، تمرکز روی بهینهسازی KV-cache مهمترین روند مهندسی در سال جاریه، چون کانتکستهای یک میلیونی بدون این تکنیکها عملاً VRAM رو منفجر میکنن.
وضعیت کانتکست طولانی هم روی ۲۶۲ هزار توکن تثبیت شده. مدلکارتها دیگه فقط بنچمارک نمیدن، بلکه دستورالعملهای دقیق سرو کردن (Serving Recipes) رو منتشر میکنن که چطور با YaRN یا اسکیپ کردن بخشهای بینایی، حافظه رو برای استدلالهای سنگین آزاد نگه داریم.
در نهایت، ما از عصر "مدلهای بزرگ" وارد عصر "سیستمهای کارا" شدیم. اگه میخواید عقب نمونید، به جای خوندن مقالات معماری، روی یادگیری زیرساختهای استنتاج مثل vLLM، SGLang و فریمورکهای RL توزیعشده مثل Slime تمرکز کنید.
📃 گزارش فنی Qwen3.5 MoE:
https://qwenlm.github.io/blog/qwen3.5/
📃 زیرساخت آموزشی Slime:
https://github.com/THUDM/slime
📃 مقاله Voxtral Realtime:
https://arxiv.org/abs/2602.11298
📃 تکنیک کوانتیزاسیون QVG:
https://arxiv.org/abs/2602.04139
🛠 Join @LLMEngineers Community
Post #309
1.31K
- 🔥 7
- ❤ 2