شیائومی با MiMo-V2-Flash نشون داد که "مهندسی عملگرا" دقیقا یعنی چی. مدل MoE با ۳۰۹ میلیارد پارامتر که فقط ۱۵ میلیاردش فعاله (Active Params)، ولی نکته اصلی سایز مدل نیست؛ شاهکار توی معماری و انتخابهای فنیشون برای بهینهسازیه.
معماری Hybrid Attention اینجا بازی رو عوض کرده. ترکیب Sliding Window Attention (SWA) با Global Attention با نسبت ۵ به ۱. نکته عجیب ماجرا اینه که Window Size رو روی ۱۲۸ بستن و نتیجه گرفتن (حتی بهتر از ۵۱۲). این یعنی ۶ برابر کاهش در مصرف حافظه KV Cache. فقط حواستون باشه، طبق گفته خودشون Attention Sink Bias رو به هیچ وجه نباید حذف کنید، چون برای حفظ کانتکست حیاتیه.
ماژول MTP یا همون Multi-Token Prediction رو هم جداگانه اپنسورس کردن. این ماژول ۳ لایه، سرعت خروجی رو ۳ برابر میکنه و مهمتر از اون، توی آموزش RL زمان بیکاری GPU رو برای نمونههای Long-tail به شدت کاهش میده. یه FFN متراکم سادهست (برعکس خود مدل که MoE هست) ولی تاثیرش توی پروداکشن وحشتناکه.
تکنیک MOPD برای Post-training هم درس بزرگیه. ایده اینه که Knowledge Distillation رو تبدیل کردن به یه فرآیند RL. دانش Teacher رو با هزینه محاسباتی ۱/۵۰ روشهای معمول (مثل SFT+RL) به Student منتقل کردن. عملا یه لوپ Self-reinforcing ساختن که مدل دانشآموز میتونه خودش تبدیل به معلم قویتری بشه.
به نظر من، MiMo-V2 فقط یه مدل زبانی نیست، یه کلاس درس برای کساییه که میخوان Inference ارزان و سریع داشته باشن و درگیر Hype سایز مدل نشن. وقتی ۱۵ میلیارد پارامتر فعال بتونه بنچمارکهای مدلهای ۳۰+ میلیاردی رو بزنه، یعنی معماری درست چیده شده.
📃 گزارش فنی و جزئیات معماری:
https://github.com/XiaomiMiMo/MiMo-V2-Flash/blob/main/paper.pdf
🤗 لینک مدل در هاگینگفیس:
https://huggingface.co/XiaomiMiMo/MiMo-V2-Flash
🛠 Join @LLMEngineers Community
Post #287
1.43K