TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #490 1.52K
بررسی چنتا مدل جدید با سایز کوچیکتر از 5B :

مدل Nanbeige4.2-3B در حال حاضر روی کاغذ باهوش‌ترین مدل و قوی‌ترین Coding Agent تو این سایزه. نتایجی مثل 63.6 روی SWE-Bench Verified و 44.1 روی Terminal-Bench 2.0 نشون میده برای کار توی Shell و دیباگ ریپازیتوری رقیب نداره. با این حال طبق تست‌های مستقل، توی Multi-tool Calling و فراخوانی همزمان چند ابزار افت شدیدی پیدا می‌کنه

در سمت دیگه، مدل Spark-X2.5-4B بالانس‌ترین گزینه است. شاید توی استدلال خام یه پله پایین‌تر از رقیبش باشه، اما پایداری خیلی خوبی توی Tool Calling و سناریوهای چندمرحله‌ای Agentic نشون داده (مثل 65.1 روی BFCL-v4 و 75.1 روی τ²). این مدل ادعای پشتیبانی از ۲۰۰ زبان رو مطرح کرده که به احتمال زیاد پوشش فارسی قابل‌قبولی داره، هرچند توانایی ترمینال اون مستقیماً بنچمارک نشده و بیشتر از روی مهارت کدنویسیش استنباط میشه.

درباره LFM2.5-2.6B قضیه شفافه: تیم LiquidAI این مدل رو مستقیماً با Agentic RL برای ابزارها و جریان‌های کاری آموزش داده و توی بنچمارک‌هایی مثل ToolSandbox و Claw-Eval عالیه؛ اما خود سازنده‌ها صریحاً اعلام کردن برای Coding Agent یا کارهای سنگین ریپازیتوری مناسب نیست. از نظر زبانی هم فارسی رسماً جزو زبان‌های پشتیبانی‌شده اون نیست.

نسخه‌های تقطیرشده مثل Qwen3.8-4B-Distill برای استدلال عمومی و ریاضیات پیشرفت خوبی داشتن، اما هنوز بنچمارک مستقلی برای کارهای ایجنتی مثل SWE-Bench یا Terminal-Bench براشون منتشر نشده. از نظر زبان فارسی، با توجه به سابقه خانواده Qwen3.5 احتمالاً انتخاب‌های مطمئن‌تری باشن، ولی تا قبل از تست مستقیم نمیشه نمره قطعی داد.

جمع‌بندی برای انتخاب و تصمیم‌گیری:
- برای کارهای Coding Agent و محیط ترمینال: مدل Nanbeige4.2-3B بهترین گزینه‌ست، به شرطی که کار به زبان انگلیسی باشه.
- برای ورک‌فلوهای عمومی Agent و استفاده چندمرحله‌ای از Tool: مدل Spark-X2.5-4B پایدارترین و متعادل‌ترین انتخابه.
- برای ابزارسازی سبک و پایپ‌لاین‌های RAG بدون نیاز به کدنویسی عمیق: مدل LFM2.5-2.6B عملکرد تمیزی داره، اما نباید روش برای فارسی حساب کرد.
- برای تسک‌های متنی عمومی و زبان فارسی: مدل‌های مبتنی بر Qwen3.8 و بعد از اون Spark گزینه‌های منطقی‌تری به حساب میان.

https://huggingface.co/Nanbeige/Nanbeige4.2-3B
https://huggingface.co/XHToken/Spark-X2.5-4B
https://huggingface.co/empero-ai/Qwen3.8-4B-Distill
https://huggingface.co/LiquidAI/LFM2.5-2.6B

🛠 Join @LLMEngineers Community
  • ❤ 1
  • 👌 1
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →