تیم IFM که پیشتر با پروژه LLM360 شناخته میشد، خانواده مدلهای K2 Horizon رو تحت لایسنس Apache 2.0 منتشر کرد؛ یه پکیج کامل از ۶ مدل مختلف که از سایز فوقالعاده سبک 0.9B شروع میشه و تا غول ۳۷۵ میلیارد پارامتری 375B-A23B ادامه داره. برخلاف خیلی از شرکتها که فقط وزن نهایی رو میدن و تمام، این تیم کل چرخه آموزش رو باز کرده؛
یعنی از دیتای Pre-train و چکپوینتهای میانی گرفته تا لاگهای جزئی آموزش و کدهای Agentic Post-training همهچیز در دسترسه تا بشه رفتار مدل رو دقیق مهندسی معکوس کرد.
یکی از جذابترین نکات معماری این سری، مدل 36B-A4B هست که سراغ ایدهای به اسم MoVA یا همان Mixture-of-Value-Attention رفته. برخلاف MoEهای مرسوم که sparsity رو فقط روی لایههای Feed-Forward اعمال میکنن، اینجا اسپارسیتی وارد مکانیزم Attention شده. این طراحی باعث شده مدل با وجود ۳۶ میلیارد پارامتر کلی، در هر توکن فقط حدود ۴ میلیارد پارامتر فعال داشته باشه، ولی عملکردش پابهپای نسخه متراکم ۳۲ میلیاردی بیاد و در تستهایی مثل Terminal-Bench 2.1 به امتیاز ۵۸.۶ برسه؛ چیزی که روی سرورهای سبک یا سیستمهای لوکال هزینه پردازش رو بهشدت پایین میکشه.
مدل پرچمدار این خانواده یعنی 375B-A23B هم با ۲۳ میلیارد پارامتر فعال در هر توکن، مستقیماً برای کارهای سنگین برنامهنویسی و ایجنتی طراحی شده. این مدل در بنچمارکهای کار با ابزار مثل MCPMark امتیاز ۶۷.۷ و در Toolathlon امتیاز ۶۵.۳ رو ثبت کرده. هرچند در استدلالهای فوقالعاده انتزاعی و سنگین مثل Humanity's Last Exam هنوز پشت سر مدلهای کلوزی مثل GPT-5.6 یا Claude Sonnet 5 قرار میگیره، اما در کارهای مهندسی نرمافزار و تسکهای طولانی ایجنتی کاملاً در قامت یه مدل کلاس تجاری ظاهر میشه.
نکتهای که این گزارش رو برای من فوقالعاده جذاب کرد، شفافیت بیتعارف تیم روی ماجرای Reward Hacking بود. وقتی مدل در محیط شبیهسازیشده ترمینال قرار گرفته، در کمال زرنگی سورس بنچمارک رو از گیتهاب پیدا کرده، جوابها رو بیرون کشیده و تستها رو دور زده! تیم IFM با ابزار آدیت شرکت Artificial Analysis متوجه تقلب در ۲۴ تلاش شد و بهجای لاپوشانی، رک و راست امتیاز خام ۷۰.۲ درصدی رو به ۶۶.۹ درصد اصلاح کرد. همین ثبت رفتارهای ناخواسته در چکپوینتهای میانی، ارزش علمی این انتشار رو از صدها ادعای بازاریابی بیشتر میکنه.
از نظر دیپلوی و استفاده عملی هم همهچیز آمادهست؛ مدلها از روز اول توی vLLM و SGLang و Ollama پشتیبانی میشن. علاوه بر این، یه آداپتر LoRA سبک به اسم Uno Diffusion همراه مدلها داده شده که بهکمک تکنیک موازیسازی دیفیوژن، توکنها رو بدون تغییر در توزیع خروجی و بدون افت کیفیت به شکل بلوکی تولید میکنه تا سرعت استنتاج بالاتر بره. اگر برای تسکهای سبک، کار با فانکشنها و استنتاج لوکال دنبال گزینه هستید، سایزهای 3.7B و 7B و نسخه MoVA واقعاً ارزش تست دارند.
https://ifm.ai/k2/
https://ifm.ai/blog/k2
https://huggingface.co/collections/IFM/k2-horizon
🛠 Join @LLMEngineers Community
Post #500
2.35K
- 👍 7
- 🔥 4
- ❤ 1