TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #310 1.54K
بنچمارک‌های عمومی هوش مصنوعی معمولاً برای زبان فارسی نیستن و اصلاً عمق فهم مدل رو نشون نمی‌دن. برای همین خودم دست‌به‌کار شدم و لیدربورد کنکور ۱۴۰۴ (نوبت اول) رو راه انداختم تا ببینم این مدل‌های متن‌باز واقعاً توی استدلال‌های پیچیده و زبان فارسی چند مرده حلاج‌ان. کنکور به خاطر ترکیب سوالات مفهومی، محاسباتی و تصاویر هندسی، عملاً سخت‌ترین تست برای سنجش Reasoning و Multimodal بودن یک مدله.

معماری MoE توی این تست ثابت کرد که پادشاه بلامنازع هست. مدل Qwen3-VL-235B با ۲۲ میلیارد پارامتر فعال، نه تنها در بخش متنی اول شد، بلکه توی بخش بینایی هم با اختلاف بقیه رو جا گذاشت. برای من به عنوان یه مهندس، رتبه سوم Qwen3-Next-80B جذاب‌تره؛ این مدل با فقط ۳ میلیارد پارامتر فعال (Active Parameters) تونسته مدل‌های غولی مثل Llama-3.1-70B رو شکست بده. این یعنی بهینه‌سازی معماری و کیفیت داده، خیلی بیشتر از تعداد خام پارامترها توی زبان فارسی تاثیر داره.

شکاف بین Text-only Score و Standard Score نشون‌دهنده یه حقیقت تلخه: مدل‌ها هنوز توی فهم تصاویر فارسی (OCR بصری و تحلیل نمودار) لنگ می‌زنن. وقتی سوال تصویری میشه، دقت اکثر مدل‌ها سقوط می‌کنه. اگه قصد دارید سیستم آموزشی یا ایجنتی بسازید که با داکیومنت‌های فارسی سر و کار داره، فعلاً باید روی خانواده Qwen3 حساب کنید. مدل Kimi-k2 هم نشون داد که توی استدلال متنی (Text Reasoning) فوق‌العاده‌ست، هرچند که توی بخش بینایی کلاً حضور نداره.

به نظر من، این لیدربورد نشون داد که عصر مدل‌های Dense تموم شده. اگر پروژه‌ای دارید که نیاز به فهم عمیق فارسی و استدلال داره، وقتتون رو روی مدل‌هایی که MoE نیستن تلف نکنید. این نتایج ثابت می‌کنه که "کارایی سیستم" (System Efficiency) و "تخصص اکسپرت‌ها" توی MoE، کلید حل پازل زبان‌های پیچیده‌ای مثل فارسیه.

🏆 لیدربورد کنکور ۱۴۰۴ در هاگینگ فیس:
https://huggingface.co/spaces/mshojaei77/konkur1404-llm-leaderboard

🛠 Join @LLMEngineers Community
  • ❤ 21
  • 👍 3
More from @llmengineers
  1. Oct 11, 2026توی یکی از پروژه‌هام با یه مشکل نسبتاً جدی روبه‌رو شدم: استخراج دقیق متن از PDFهای فارسی ب…
  2. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  3. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  4. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →