🧠 مایکروسافت مدل جدید Mage-VL رو منتشر کرد؛ یک مدل چندوجهیِ «کدک-محور» برای درک ویدیو و استریم زنده
مایکروسافت دو مدل بههممرتبط رو روی HuggingFace منتشر کرده:
🔹 مدل Mage-VL — مدل چندوجهیِ ۴ میلیارد پارامتری (بر پایهی Qwen3-4B) که همزمان تصویر، ویدیوی کوتاه/بلند و استریم زنده رو درک میکنه.
🔹 مدل Mage-ViT — انکودر بصری همین مدل، که کاملاً از صفر (بدون هیچ پیشآموزش تصویر-متنِ میلیاردی) آموزش دیده.
✨ ایده
بهجای اینکه ویدیو رو به فریمهای یکنواخت تبدیل کنن و همهشون رو به مدل بدن (که پرهزینهست)، از منطق کدکهای ویدیویی (مثل H.264/HEVC) الهام گرفتن: فقط فریمهای کلیدی (I-frame) کامل نگه داشته میشن و از فریمهای پیشبینیشده (P-frame) فقط بخشهایی که واقعاً حرکت/تغییر دارن انتخاب میشن. نتیجه؟
• کاهش بیش از ۷۵٪ در تعداد توکنهای بصری
• تا ۳.۵ برابر سرعت بیشتر در inference
• آموزش روی ویدیوهایی تا ۸ برابر طولانیتر با همون بودجهی محاسباتی
📊 عملکرد:
با همون بکبون ۴B، در تقریباً همهی بنچمارکهای ویدیویی و درک مکانی از Qwen3-VL-4B جلوتره (مثلاً +۲۲.۵ در QVHighlight و +۱۱ در VSI-Bench)، و در تصاویر استاتیک همسطح یا کمی بهتره.
🎙️ یه قابلیت جالب دیگه: یک «گیت شناختی» سبک داره که مدل رو در حالت استریم فقط وقتی «رویداد قابلتوجهی» رخ بده فعال میکنه (مثلاً روی گزارش زندهی فوتبال تست شده) — بدون نیاز به چند مدل جدا.
🔗 Mage-VL: https://huggingface.co/microsoft/Mage-VL
🔗 Mage-ViT: https://huggingface.co/microsoft/Mage-ViT
Post #4354
2.48K