تیم OpenBMB مدل جدید MiniCPM5-2B را با معماری استاندارد Llama و تحت مجوز Apache-2.0 منتشر کرد. این مدل با اندازه ۲ میلیارد پارامتر به طور ویژه برای اجرا روی دستگاههای محلی (On-device)، دستیارهای کدنویسی و تسکهای مبتنی بر ایجنت طراحی شده و با وجود جثه کوچکش، نباید اصلاً دستکم گرفته شود؛ حتماً دانلودش کنید و عملکردش را خودتان تست کنید چون حتی از مدلهای بزرگتر رده 4B هم در بنچمارکها پیشی گرفته است.
ویژگیها و دستاوردهای کلیدی این مدل:
🔹 عملکرد فراتر از انتظار در تسکهای ایجنتی و کدنویسی:
در بنچمارک SWE-bench Verified به امتیاز ۴۶.۴٪ رسیده که برای یک مدل 2B رقمی فوقالعاده است. همچنین در ارزیابیهای سرچ ایجنت (GAIA Text-103) امتیاز ۸۸.۷٪ و در ابزارمحوری (Tool Use) امتیازات بسیار بالایی ثبت کرده است.
🔹 قدرت استدلال ریاضی و کد (Deep Reasoning):
در حل مسائل ریاضی سطح بالا از جمله AIME 2025/2026 امتیاز ۸۶.۵٪ و در MATH-500 امتیاز ۹۴.۶٪ به دست آورده است. در آزمون LiveCodeBench v6 نیز نمره ۶۹.۱٪ را به ثبت رسانده است.
🔹 پشتیبانی بومی از طول زمینه ۱۲۸K:
مدل به صورت پیشفرض از کانتکست ۱۲۸ هزار توکن (131K) برای پردازش مستندات طولانی پشتیبانی میکند.
🔹 پایپلاین آموزشی و تقطیر ایجنتی (RL + OPD):
آموزش این مدل شامل SFT عمیق تفکر، یادگیری تقویتی (RL) بر پایه الگوریتم JustRL II و در نهایت تقطیر سیاستی (On-Policy Distillation) حاصل از ۱۶ مدل تخصصی اکسپرت (از جمله ۵ اکسپرت ایجنتی) است. مجموعهدادههای آموزشی این مدل نیز به عنوان بخشی از پروژه UltraData منتشر شدهاند.
🔹 استقرار سریع با فریمورکهای استاندارد:
پشتیبانی بدون نیاز به کرنل کاستوم در vLLM ،SGLang و Hugging Face Transformers.
صفحه مدل در هاگینگفیس:
https://huggingface.co/openbmb/MiniCPM5-2B
پروژه در گیتهاب:
https://github.com/OpenBMB/MiniCPM
Post #489
414