💡 پژوهشگران ByteDance و استنفورد روشی تازه برای ساخت ویدیوهای طولانی معرفی کردهاند: Mixture of Contexts.
🔑 مشکل اصلی:
وقتی ویدیو طولانی میشود، توجه مدل بیش از حد گسترده میشود:
هزینهی محاسبات بالا میرود
جزئیات از دست میرود
شخصیتها فراموش میشوند و ویدیو دچار «انحراف» میگردد
⚡ نوآوری Mixture of Contexts:
ویدیو به بخشهایی (فریمها، شاتها، کپشنها) تقسیم میشود
هر بار فقط بخشهای مرتبط انتخاب میشوند، نه کل تاریخچه
انتخاب بخشها با مقایسهی ویژگیها و ارزیابی میزان ارتباط انجام میشود
دو «لنگر» همیشه حفظ میشوند: پرامپت کامل متنی و شات محلی برای جزئیات
Causal Mask دسترسی به فریمهای آینده را میبندد تا حلقهی تکراری ایجاد نشود
سپس Flash Attention فقط روی همین بخشهای منتخب اعمال میشود → محاسبات وابسته به کل طول ویدیو نیست، بلکه فقط به محتوای مفید
📊 نتایج:
۷ برابر کاهش FLOPs
۲.۲ برابر سرعت بیشتر
در صحنههای طولانی (۱۸۰هزار توکن) تا ۸۵٪ توجه بیهوده حذف میشود
🎥 دستاورد:
کیفیت کلیپهای کوتاه حفظ میشود
صحنههای بلند روانتر و شخصیتها پایدارتر هستند
Post #2730
489

