TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #309 1.31K
نقشه راه هوش مصنوعی در ابتدای سال ۲۰۲۶ از "تئوری‌های معماری" فاصله گرفته و کاملاً وارد قلمرو "مهندسی سیستم" شده. مدل‌های جدید مثل Qwen3.5 و GLM-5 نشون دادن که جنگِ پارامترها جای خودش رو به جنگِ نرخ توکن (Throughput) و مدیریت حافظه داده. واقعیت اینه که داشتن یه مدل ۷۴۴ میلیاردی بدون زیرساخت استنتاج بهینه، عملاً بی‌استفاده‌ست.

معماری Sparse MoE حالا دیگه انتخاب اول برای اسکیل کردن مدل‌هاست. مدل Qwen3.5 با ۳۹۷ میلیارد پارامتر که فقط ۱۷ میلیاردش فعاله، ثابت کرد که میشه با ۵۱۲ اکسپرت به دقت مدل‌های متراکم رسید ولی با هزینه‌ای بسیار کمتر. استفاده از Gated Delta Networks و Hybrid Linear Attention توی این مدل‌ها، مشکل همیشگی حافظه در کانتکست‌های طولانی رو حل کرده. به نظر من، نکته طلایی این انتشارها Multi-Token Prediction (MTP) هست؛ تکنیکی که اجازه میده مدل در هر گام چندین توکن رو پیش‌بینی کنه و سرعت استنتاج رو تا ۱۹ برابر بالا ببره. این یعنی ایجنت‌های هوشمند دیگه نباید ثانیه‌ها منتظر جواب بمونن.

زیرساخت Slime نشون داد که RL (یادگیری تقویت‌شده) از یه مرحله فرعی در پس‌آموزش، به یه "سیستم توزیع‌شده سنگین" تبدیل شده. جدا کردن بخش تولید داده (Rollout) از بخش آموزش (Training) در Slime، اجازه میده که مدل‌های MoE غول‌آسا با پایداری بالا تیون بشن. این یعنی ما دیگه دنبال معماری جدید نیستیم، بلکه دنبال پایپ‌لاین‌های RL پایدارتری هستیم که بتونن رفتار ایجنت رو در سناریوهای طولانی اصلاح کنن.

صوت و OCR هم دارن به سمت "نیتیو" شدن حرکت می‌کنن. مدل‌هایی مثل Voxtral Realtime و Nemotron نشون دادن که دوران تکه‌تکه کردن صوت (Chunking) تموم شده. ما الان مدل‌های ASR با تاخیر زیر ۵۰۰ میلی‌ثانیه داریم که مستقیماً با انکودرهای علّی (Causal) آموزش دیدن. در بخش OCR هم مدل LightOnOCR ثابت کرد که دیدگاه VLM (مدل بینایی-زبانی) برای فهم اسناد، بسیار برتر از پایپ‌لاین‌های قدیمی تشخیص و بازشناسیه. تبدیل مستقیم تصویر سند به Markdown تمیز، حالا دیگه یک مسئله حل شده‌ست.

تولید ویدیو هم با تکنیک QVG و کوانتیزاسیون ۲ بیتی KV-cache وارد فاز عملیاتی شده. وقتی می‌تونید مصرف حافظه رو ۷ برابر کم کنید بدون اینکه کیفیت ویدیو نابود بشه، یعنی امکان اجرای مدل‌های جهان (World Models) روی کارت‌های گرافیک معمولی فراهم شده. به نظر من، تمرکز روی بهینه‌سازی KV-cache مهم‌ترین روند مهندسی در سال جاریه، چون کانتکست‌های یک میلیونی بدون این تکنیک‌ها عملاً VRAM رو منفجر می‌کنن.

وضعیت کانتکست طولانی هم روی ۲۶۲ هزار توکن تثبیت شده. مدل‌کارت‌ها دیگه فقط بنچمارک نمیدن، بلکه دستورالعمل‌های دقیق سرو کردن (Serving Recipes) رو منتشر می‌کنن که چطور با YaRN یا اسکیپ کردن بخش‌های بینایی، حافظه رو برای استدلال‌های سنگین آزاد نگه داریم.

در نهایت، ما از عصر "مدل‌های بزرگ" وارد عصر "سیستم‌های کارا" شدیم. اگه می‌خواید عقب نمونید، به جای خوندن مقالات معماری، روی یادگیری زیرساخت‌های استنتاج مثل vLLM، SGLang و فریم‌ورک‌های RL توزیع‌شده مثل Slime تمرکز کنید.

📃 گزارش فنی Qwen3.5 MoE:
https://qwenlm.github.io/blog/qwen3.5/

📃 زیرساخت آموزشی Slime:
https://github.com/THUDM/slime

📃 مقاله Voxtral Realtime:
https://arxiv.org/abs/2602.11298

📃 تکنیک کوانتیزاسیون QVG:
https://arxiv.org/abs/2602.04139

🛠 Join @LLMEngineers Community
  • 🔥 7
  • ❤ 2
More from @llmengineers
  1. Oct 11, 2026توی یکی از پروژه‌هام با یه مشکل نسبتاً جدی روبه‌رو شدم: استخراج دقیق متن از PDFهای فارسی ب…
  2. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  3. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  4. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →