دیروز تیم Qwen مدل Qwen3.8-27B رو منتشر کرد؛ یه مدل open-weight و multimodal که با فقط ۲۷B پارامتر در coding agent، computer use، browser task و کارهای حرفهای طولانی به سطح مدلهای خیلی بزرگتر رسیده.
گزارشهای اولیه میگن مدل قبل از جوابدادن، مسئله رو کاملتر داخل reasoning خودش میسازه؛ انگار یک build کامل رو درون trajectory اجرا میکنه و بعد خروجی نهایی رو میده. این باعث شده verbose thinking اینبار بیشتر شبیه مزیت باشه تا اتلاف توکن.
از نظر فنی هم تصویر، ویدیو، reasoning قابل تنظیم، context native تا ۲۶۲K و امکان گسترش تا حدود ۱M توکن رو داره.
اگر این روند ادامه پیدا کنه، agentهای جدی کمکم از مدلهای عظیم ابری جدا میشن و روی سختافزار محلی هم قابل اجرا میشن.
جهت حرکت کاملاً مشخصه: مدلهای agentic دارن کوچکتر، ارزانتر و عملیاتیتر میشن.
🛠 Join @LLMEngineers Community
Post #478
1.34K


- 👍 2
- 🔥 1