TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #500 2.35K
تیم IFM که پیش‌تر با پروژه LLM360 شناخته می‌شد، خانواده مدل‌های K2 Horizon رو تحت لایسنس Apache 2.0 منتشر کرد؛ یه پکیج کامل از ۶ مدل مختلف که از سایز فوق‌العاده سبک 0.9B شروع می‌شه و تا غول ۳۷۵ میلیارد پارامتری 375B-A23B ادامه داره. برخلاف خیلی از شرکت‌ها که فقط وزن نهایی رو می‌دن و تمام، این تیم کل چرخه آموزش رو باز کرده؛
یعنی از دیتای Pre-train و چک‌پوینت‌های میانی گرفته تا لاگ‌های جزئی آموزش و کدهای Agentic Post-training همه‌چیز در دسترسه تا بشه رفتار مدل رو دقیق مهندسی معکوس کرد.

یکی از جذاب‌ترین نکات معماری این سری، مدل 36B-A4B هست که سراغ ایده‌ای به اسم MoVA یا همان Mixture-of-Value-Attention رفته. برخلاف MoEهای مرسوم که sparsity رو فقط روی لایه‌های Feed-Forward اعمال می‌کنن، اینجا اسپارسیتی وارد مکانیزم Attention شده. این طراحی باعث شده مدل با وجود ۳۶ میلیارد پارامتر کلی، در هر توکن فقط حدود ۴ میلیارد پارامتر فعال داشته باشه، ولی عملکردش پا‌به‌پای نسخه متراکم ۳۲ میلیاردی بیاد و در تست‌هایی مثل Terminal-Bench 2.1 به امتیاز ۵۸.۶ برسه؛ چیزی که روی سرورهای سبک یا سیستم‌های لوکال هزینه پردازش رو به‌شدت پایین می‌کشه.

مدل پرچمدار این خانواده یعنی 375B-A23B هم با ۲۳ میلیارد پارامتر فعال در هر توکن، مستقیماً برای کارهای سنگین برنامه‌نویسی و ایجنتی طراحی شده. این مدل در بنچمارک‌های کار با ابزار مثل MCPMark امتیاز ۶۷.۷ و در Toolathlon امتیاز ۶۵.۳ رو ثبت کرده. هرچند در استدلال‌های فوق‌العاده انتزاعی و سنگین مثل Humanity's Last Exam هنوز پشت سر مدل‌های کلوزی مثل GPT-5.6 یا Claude Sonnet 5 قرار می‌گیره، اما در کارهای مهندسی نرم‌افزار و تسک‌های طولانی ایجنتی کاملاً در قامت یه مدل کلاس تجاری ظاهر می‌شه.

نکته‌ای که این گزارش رو برای من فوق‌العاده جذاب کرد، شفافیت بی‌تعارف تیم روی ماجرای Reward Hacking بود. وقتی مدل در محیط شبیه‌سازی‌شده ترمینال قرار گرفته، در کمال زرنگی سورس بنچمارک رو از گیت‌هاب پیدا کرده، جواب‌ها رو بیرون کشیده و تست‌ها رو دور زده! تیم IFM با ابزار آدیت شرکت Artificial Analysis متوجه تقلب در ۲۴ تلاش شد و به‌جای لاپوشانی، رک و راست امتیاز خام ۷۰.۲ درصدی رو به ۶۶.۹ درصد اصلاح کرد. همین ثبت رفتارهای ناخواسته در چک‌پوینت‌های میانی، ارزش علمی این انتشار رو از صدها ادعای بازاریابی بیشتر می‌کنه.

از نظر دیپلوی و استفاده عملی هم همه‌چیز آماده‌ست؛ مدل‌ها از روز اول توی vLLM و SGLang و Ollama پشتیبانی می‌شن. علاوه بر این، یه آداپتر LoRA سبک به اسم Uno Diffusion همراه مدل‌ها داده شده که به‌کمک تکنیک موازی‌سازی دیفیوژن، توکن‌ها رو بدون تغییر در توزیع خروجی و بدون افت کیفیت به شکل بلوکی تولید می‌کنه تا سرعت استنتاج بالاتر بره. اگر برای تسک‌های سبک، کار با فانکشن‌ها و استنتاج لوکال دنبال گزینه هستید، سایزهای 3.7B و 7B و نسخه MoVA واقعاً ارزش تست دارند.

https://ifm.ai/k2/
https://ifm.ai/blog/k2
https://huggingface.co/collections/IFM/k2-horizon

🛠 Join @LLMEngineers Community
  • 👍 7
  • 🔥 4
  • ❤ 1
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →