A highly technical blog tailored for AI engineers.
Chat: @AI_LLMs
Personal blog: mshojaei77.github.io/
Contact me: @realshojaeii
Post #310
1.54K
بنچمارکهای عمومی هوش مصنوعی معمولاً برای زبان فارسی نیستن و اصلاً عمق فهم مدل رو نشون نمیدن. برای همین خودم دستبهکار شدم و لیدربورد کنکور ۱۴۰۴ (نوبت اول) رو راه انداختم تا ببینم این مدلهای متنباز واقعاً توی استدلالهای پیچیده و زبان فارسی چند مرده حلاجان. کنکور به خاطر ترکیب سوالات مفهومی، محاسباتی و تصاویر هندسی، عملاً سختترین تست برای سنجش Reasoning و Multimodal بودن یک مدله.
معماری MoE توی این تست ثابت کرد که پادشاه بلامنازع هست. مدل Qwen3-VL-235B با ۲۲ میلیارد پارامتر فعال، نه تنها در بخش متنی اول شد، بلکه توی بخش بینایی هم با اختلاف بقیه رو جا گذاشت. برای من به عنوان یه مهندس، رتبه سوم Qwen3-Next-80B جذابتره؛ این مدل با فقط ۳ میلیارد پارامتر فعال (Active Parameters) تونسته مدلهای غولی مثل Llama-3.1-70B رو شکست بده. این یعنی بهینهسازی معماری و کیفیت داده، خیلی بیشتر از تعداد خام پارامترها توی زبان فارسی تاثیر داره.
شکاف بین Text-only Score و Standard Score نشوندهنده یه حقیقت تلخه: مدلها هنوز توی فهم تصاویر فارسی (OCR بصری و تحلیل نمودار) لنگ میزنن. وقتی سوال تصویری میشه، دقت اکثر مدلها سقوط میکنه. اگه قصد دارید سیستم آموزشی یا ایجنتی بسازید که با داکیومنتهای فارسی سر و کار داره، فعلاً باید روی خانواده Qwen3 حساب کنید. مدل Kimi-k2 هم نشون داد که توی استدلال متنی (Text Reasoning) فوقالعادهست، هرچند که توی بخش بینایی کلاً حضور نداره.
به نظر من، این لیدربورد نشون داد که عصر مدلهای Dense تموم شده. اگر پروژهای دارید که نیاز به فهم عمیق فارسی و استدلال داره، وقتتون رو روی مدلهایی که MoE نیستن تلف نکنید. این نتایج ثابت میکنه که "کارایی سیستم" (System Efficiency) و "تخصص اکسپرتها" توی MoE، کلید حل پازل زبانهای پیچیدهای مثل فارسیه.
🏆 لیدربورد کنکور ۱۴۰۴ در هاگینگ فیس:
https://huggingface.co/spaces/mshojaei77/konkur1404-llm-leaderboard
🛠 Join @LLMEngineers Community
معماری MoE توی این تست ثابت کرد که پادشاه بلامنازع هست. مدل Qwen3-VL-235B با ۲۲ میلیارد پارامتر فعال، نه تنها در بخش متنی اول شد، بلکه توی بخش بینایی هم با اختلاف بقیه رو جا گذاشت. برای من به عنوان یه مهندس، رتبه سوم Qwen3-Next-80B جذابتره؛ این مدل با فقط ۳ میلیارد پارامتر فعال (Active Parameters) تونسته مدلهای غولی مثل Llama-3.1-70B رو شکست بده. این یعنی بهینهسازی معماری و کیفیت داده، خیلی بیشتر از تعداد خام پارامترها توی زبان فارسی تاثیر داره.
شکاف بین Text-only Score و Standard Score نشوندهنده یه حقیقت تلخه: مدلها هنوز توی فهم تصاویر فارسی (OCR بصری و تحلیل نمودار) لنگ میزنن. وقتی سوال تصویری میشه، دقت اکثر مدلها سقوط میکنه. اگه قصد دارید سیستم آموزشی یا ایجنتی بسازید که با داکیومنتهای فارسی سر و کار داره، فعلاً باید روی خانواده Qwen3 حساب کنید. مدل Kimi-k2 هم نشون داد که توی استدلال متنی (Text Reasoning) فوقالعادهست، هرچند که توی بخش بینایی کلاً حضور نداره.
به نظر من، این لیدربورد نشون داد که عصر مدلهای Dense تموم شده. اگر پروژهای دارید که نیاز به فهم عمیق فارسی و استدلال داره، وقتتون رو روی مدلهایی که MoE نیستن تلف نکنید. این نتایج ثابت میکنه که "کارایی سیستم" (System Efficiency) و "تخصص اکسپرتها" توی MoE، کلید حل پازل زبانهای پیچیدهای مثل فارسیه.
🏆 لیدربورد کنکور ۱۴۰۴ در هاگینگ فیس:
https://huggingface.co/spaces/mshojaei77/konkur1404-llm-leaderboard
🛠 Join @LLMEngineers Community
- ❤ 21
- 👍 3