مدل جدید کیمی K3 کلاً قضیه مدلهای متنباز رو وارد یه مرحله جدید کرده... یه مدل غولپیکر با ۲.۸ تریلیون پارامتر کل که موقع جواب دادن به هر کلمه، ۱۰۴ میلیارد پارامترش فعال میشن و تا ۱ میلیون توکن متن یا تصویر رو همزمان پردازش میکنه.
سازندههاش تونستن بازدهی آموزش مدل رو نسبت به نسل قبل ۲.۵ برابر بهتر کنن. خلاصه تغییرات مهمش ایناست:
- ترکیب هوشمندانه توجه (Hybrid Attention):
برای اینکه موقع خواندن متنهای خیلی طولانی حافظه کارت گرافیک پر نشه، ۳ لایه از یک مکانیزم سبک و سریع خطی با نام Kimi Delta Attention استفاده کردن و بعد ۱ لایه توجه کامل با نام Gated MLA گذاشتن. این ترکیب باعث میشه مدل متنهای طولانی رو بدون کند شدن بفهمه.
- برداشت هوشمند از لایههای قبلی (Attention Residuals):
توی مدلهای قدیمی، هر لایه فقط اطلاعات لایه قبلی خودش رو میگرفت. اینجا هر لایه میتونه برگرده و بر اساس نیاز از اطلاعات لایههای خیلی عقبتر هم استفاده کنه تا مفاهیم پیچیده رو فراموش نکنه.
- تقسیم کار بین ۸۹۶ کارشناس کوچک (MoE):
به جای یک شبکه یکدست، مدل از ۸۹۶ کارشناس تخصصی کوچک تشکیل شده که برای هر کلمه فقط ۱۶ تاشون انتخاب میشن. با یک روش ریاضی جدید به اسم Quantile Balancing کاری کردن که بار پردازشی کاملاً مساوی تقسیم بشه و هیچ کارشناسی بیکار نمونه.
- پردازش تصویر بومی بدون مدل کمکی (MoonViT-V2):
بخش فهم تصویر مدل از همون روز اول همراه با متن آموزش دیده؛ برعکس مدلهای دیگه که یک مدل تصویربردار آماده رو به متن وصل میکردن. این کار پایداری مدل رو موقع یادگیری خیلی بالاتر برده.
چرا این مدل مهمه؟
- توی تستهای کدنویسی و هوش خودکار (مثل چرخیدن توی وب و انجام کارهای چندمرحلهای) پابهپای قویترین مدلهای تجاری مثل Claude Fable 5 و GPT-5.6 Sol میاد.
- نمره ۹۳.۵٪ توی آزمون دانش و استدلال GPQA Diamond گرفته.
- هزینهی اجرایی هر درخواستش حدود یکسوم مدلهای تجاری مشابه هست.
نقطه ضعفش کجاست؟
توی استدلالهای خیلی پیچیده در سطح تحقیقات علمی (مثل بنچمارک CritPt با نمره ۲۳.۴٪) هنوز عقبتر از مدلهای تجاری قوی میافته که نشون میده مدلهای متنباز توی استدلال عمیق هنوز جای کار دارن.
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
🛠 Join @LLMEngineers Community
Post #440
1.33K