خانواده مدلهای Nex-N2 بر پایه Qwen 3.5 توسعه داده شدن و هدف اصلیشون حل چالشهای عملیاتی در سیستمهای Agentic هست. این مدلها به جای تمرکز روی چت جنرال، روی Code Implementation و Tool-use بهینهسازی شدن تا در لوپهای طولانیمدت (Long-horizon tasks) پایدار بمونن. مدل Nex-N2-Pro از معماری MoE با ۳۹۷ میلیارد پارامتر کلی و ۱۷ میلیارد پارامتر فعال استفاده میکنه که کانتکست Window آن ۲۶۲ هزار توکن است.
مکانیزم فنی Adaptive Thinking در این مدل، طول زنجیره استدلال (Reasoning Chain) رو بر اساس سختی سوال تغییر میده. این یعنی در تسکهای ساده، توکن اضافی برای فکر کردن هدر نمیره و طبق ادعای تیم توسعه، حدود ۲۰ درصد مصرف توکن بدون کاهش دقت پایین اومده. در تسکهای پیچیده مثل SWE-bench که نیاز به تغییر در سورسکد واقعی دارن، مدل از سیستم Coherent Thinking استفاده میکنه تا بین مرحله سرچ، کدنویسی و تست، پارادایم منطقی یکسانی رو حفظ کنه و دچار ناسازگاری نشه.
تجربههای واقعی تسترها در کامیونیتی LocalLLaMA و X نشون میده که مدل توی کدنویسی پایتون و ساخت اپلیکیشنهای تکصفحهای عملکردی مشابه GPT-4o و حتی در مواردی بهتر از آن داشته. با این حال، گزارشهایی مبنی بر گیر کردن در Repetition Loop در مواجهه با لینکهای خراب یا ارورهای ۴۰۴ وجود داره. یعنی مدل وقتی با مانع محیطی غیرمنتظره برخورد میکنه، گاهی به جای تغییر استراتژی، روی تسک قبلی اصرار میکنه که نشاندهنده نیاز به Tuning بیشتر در بخش Error Handling هست.
به نظر من، این مدل یک ابزار تخصصی برای برنامهنویسها و توسعهدهندههای Agent هست و نباید به عنوان جایگزین مدلهای جنرال برای نوشتن متن یا تحقیقهای ساده استفاده بشه. تمرکز اصلی روی Actionable Output هست و اگر دنبال اتومیشن در ترمینال یا دیباگ خودکار کد هستید، ارزش تست کردن رو داره، مخصوصاً با توجه به لایسنس Apache 2.0 که اجازه استفاده تجاری رو میده.
🤗 مدل Nex-N2-Pro در Hugging Face:
https://huggingface.co/nex-agi/Nex-N2-Pro
▫️دسترسی رایگان در OpenRouter:
https://openrouter.ai/nex-agi/Nex-N2-Pro:free
🛠 Join @LLMEngineers Community
Post #327
1.26K
- 👍 2