اگه واسه سیستمهای ایجنتیک یا پروژههای RAG نیاز به پردازش همزمان تصویر، صدا و متن دارید، این مدل الان یکی از منطقیترین گزینههاست. کاربرد عملیش اینه که جای درگیر شدن با سه تا مدل مختلف واسه ویژن و وویس و تکست، مستقیما از API این استفاده کنید. چون مدل به صورت نیتیو مالتیمودال ترین شده و همه ورودیها تو یه هیدن اسپیس مشترک پردازش میشن.
معماریش یه هیولای ۹۵۲ میلیارد پارامتریه که حدود ۴۱ میلیاردش تو هر توکن اکتیوه. یعنی عملا ۱۶ تا کارت H200. حتی نسخه کوانتایز شده NVFP4 هم ۶۰۰ گیگ مموری میخواد. پس عملا اجرای لوکالش واسه ماها قفله و باید از همون سرویس Tinker خودشون یا پرووایدرهای دیگه استفاده بشه.
بچههای تیم سازندهش که اکثرا از OpenAI اومدن بیرون، تصمیم جالبی واسه اسکیل کردن گرفتن. برگشتن سمت muP یا همون Maximal Update Parametrization. چند وقت پیش یه پیپر میخوندم که نشون میداد واسه مدلهای بالای یک تریلیون پارامتر، این روش چطور پایداری ترینینگ رو تضمین میکنه. ۴۵ تریلیون توکن دیتای آموزشی به خورد مدل داده شده که تو فضای اوپنها یه عدد عجیبه.
چیز عجیبی که تو معماری attention دیده میشه، ترکیبش با کانولوشنه. به علاوه اینکه اومدن weight decay رو با learning rate گره زدن. قطعا یه دلیل بهینهسازی پشتش بوده ولی به شدت وابسته به ستاپ کاستوم خودشونه. از اون طرف، تو بحث پردازش تصویر، از یه انکودر پچ سلسلهمراتبی استفاده شده و صدا هم به صورت توکنهای گسسته درمیاد. این یکپارچگی روی درک کدهای پیچیده و تسکهای reasoning تاثیر مثبت گذاشته.
🛠 Join @LLMEngineers Community
Post #416
1.18K
- 👌 3