TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #280 1.86K
مروری بر وضعیت مدل‌های باز در پایان سال ۲۰۲۵: سقوط Llama و پادشاهی اژدهای چینی

سال ۲۰۲۵ سالی بود که "Open Model" از یک انتخاب برای حفظ حریم خصوصی، به انتخاب اول برای Performance تبدیل شد. شکاف بین مدل‌های اختصاصی (Closed) و باز تقریبا از بین رفته. اگر هنوز روی استک ۲۰۲۴ و Llama 3 مانده‌اید، عملاً دارید با تکنولوژی منسوخ کار می‌کنید.

اکوسیستم در ۱۲ ماه گذشته زیر و رو شد. در حالی که سال ۲۰۲۴ همه منتظر Llama بعدی بودند، سال ۲۰۲۵ با تسلط کامل DeepSeek و Qwen تمام شد.

تحلیل فنی و کاربردی برترین‌های امسال:

مدل DeepSeek R1: نقطه عطف سال
اهمیت این مدل که ژانویه ۲۰۲۵ ریلیز شد، فقط در بنچمارک‌ها نبود. تیم DeepSeek با انتشار این مدل تحت لایسنس MIT بازی را عوض کرد (برخلاف لایسنس محدود V3). این حرکت باعث شد سایر لابراتوارهای چینی هم مجبور شوند گارد را باز کنند.
به نظر من، این مدل ثابت کرد که نوآوری دیگر در انحصار تیم‌های چند هزار نفره نیست. یک تیم کوچک و متمرکز توانست استانداردها را جابجا کند.

خانواده Qwen 3: استاندارد جدید صنعت
واقعیت این است که Qwen جای Llama را به عنوان مدل Default برای Fine-tuning گرفت. الان Qwen 3 همه چیز را پوشش می‌دهد: از مدل‌های Dense و MoE گرفته تا Vision و Omni.
تنوع سایز و قدرت Multilingual این مدل باعث شده اکثر پیاده‌سازی‌های آکادمیک و پروداکشن روی این بیس انجام شود. اگر الان دارید پایپ‌لاین جدید بالا می‌آورید، Qwen 3 انتخاب منطقی‌تری نسبت به Llama است.

مدل GPT-OSS: حرکت اجباری OpenAI
بالاخره OpenAI هم تسلیم فشار بازار شد و مدل باز داد. اما گول اسمش را نخورید. این مدل در General Knowledge و زبان‌های غیرانگلیسی ضعیف است.
کاربرد اصلی آن در سیستم‌های Agentic است. OpenAI سطوح مختلف "Thinking" را در این مدل پیاده کرده که برای تسک‌های استدلالی عالی است، اما به عنوان یک مدل General purpose توصیه نمی‌شود.

معماری‌های جدید و مدل‌های خاص
انویدیا با Nemotron 2 نشان داد که دوران Transformer خالص رو به پایان است. معماری هیبرید Mamba2-Transformer در این مدل، سرعت Inference را در Context‌های طولانی به شدت افزایش داده.
برای پردازش صدا (STT)، مدل Parakeet 3 الان SOTA محسوب می‌شود و عملاً Whisper را در محیط‌های لوکال (مخصوصا روی مک‌بوک) از نظر Latency و دقت شکست داده.

وضعیت کلی و Tier List مهندسی
در حال حاضر رده‌بندی خانواده مدل های اوپن سورس به این صورت است:

فرانتیر (Frontier):
DeepSeek, Qwen, Moonshot AI (Kimi)
رقبای نزدیک:
Zhipu (GLM) , Minimax
قابل توجه:
Nvidia, Mistral, Google (Gemma 3)
در حاشیه:
Meta (Llama)
(بله، متا دیگر پیشرو نیست و آینده Llama مبهم است)

منبع:
interconnects.ai/p/2025-open-models-year-in-review

🛠 Join @LLMEngineers Community
More from @llmengineers
  1. Oct 11, 2026توی یکی از پروژه‌هام با یه مشکل نسبتاً جدی روبه‌رو شدم: استخراج دقیق متن از PDFهای فارسی ب…
  2. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  3. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  4. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →