بررسی چنتا مدل جدید با سایز کوچیکتر از 5B :
مدل Nanbeige4.2-3B در حال حاضر روی کاغذ باهوشترین مدل و قویترین Coding Agent تو این سایزه. نتایجی مثل 63.6 روی SWE-Bench Verified و 44.1 روی Terminal-Bench 2.0 نشون میده برای کار توی Shell و دیباگ ریپازیتوری رقیب نداره. با این حال طبق تستهای مستقل، توی Multi-tool Calling و فراخوانی همزمان چند ابزار افت شدیدی پیدا میکنه
در سمت دیگه، مدل Spark-X2.5-4B بالانسترین گزینه است. شاید توی استدلال خام یه پله پایینتر از رقیبش باشه، اما پایداری خیلی خوبی توی Tool Calling و سناریوهای چندمرحلهای Agentic نشون داده (مثل 65.1 روی BFCL-v4 و 75.1 روی τ²). این مدل ادعای پشتیبانی از ۲۰۰ زبان رو مطرح کرده که به احتمال زیاد پوشش فارسی قابلقبولی داره، هرچند توانایی ترمینال اون مستقیماً بنچمارک نشده و بیشتر از روی مهارت کدنویسیش استنباط میشه.
درباره LFM2.5-2.6B قضیه شفافه: تیم LiquidAI این مدل رو مستقیماً با Agentic RL برای ابزارها و جریانهای کاری آموزش داده و توی بنچمارکهایی مثل ToolSandbox و Claw-Eval عالیه؛ اما خود سازندهها صریحاً اعلام کردن برای Coding Agent یا کارهای سنگین ریپازیتوری مناسب نیست. از نظر زبانی هم فارسی رسماً جزو زبانهای پشتیبانیشده اون نیست.
نسخههای تقطیرشده مثل Qwen3.8-4B-Distill برای استدلال عمومی و ریاضیات پیشرفت خوبی داشتن، اما هنوز بنچمارک مستقلی برای کارهای ایجنتی مثل SWE-Bench یا Terminal-Bench براشون منتشر نشده. از نظر زبان فارسی، با توجه به سابقه خانواده Qwen3.5 احتمالاً انتخابهای مطمئنتری باشن، ولی تا قبل از تست مستقیم نمیشه نمره قطعی داد.
جمعبندی برای انتخاب و تصمیمگیری:
- برای کارهای Coding Agent و محیط ترمینال: مدل Nanbeige4.2-3B بهترین گزینهست، به شرطی که کار به زبان انگلیسی باشه.
- برای ورکفلوهای عمومی Agent و استفاده چندمرحلهای از Tool: مدل Spark-X2.5-4B پایدارترین و متعادلترین انتخابه.
- برای ابزارسازی سبک و پایپلاینهای RAG بدون نیاز به کدنویسی عمیق: مدل LFM2.5-2.6B عملکرد تمیزی داره، اما نباید روش برای فارسی حساب کرد.
- برای تسکهای متنی عمومی و زبان فارسی: مدلهای مبتنی بر Qwen3.8 و بعد از اون Spark گزینههای منطقیتری به حساب میان.
https://huggingface.co/Nanbeige/Nanbeige4.2-3B
https://huggingface.co/XHToken/Spark-X2.5-4B
https://huggingface.co/empero-ai/Qwen3.8-4B-Distill
https://huggingface.co/LiquidAI/LFM2.5-2.6B
🛠 Join @LLMEngineers Community
Post #490
1.52K
- ❤ 1
- 👌 1