امروز داشتم گزارش GDPval رو میخوندم؛ بنچمارک رسمی OpenAI که بهجای سؤال آکادمیک، کارهای واقعی و پولساز رو تست میکنه. ۱۳۲۰ تسک از ۴۴ شغل توی ۹ بخش اصلی GDP آمریکا، همه ساختهشده توسط متخصصهای واقعی با میانگین ۱۴ سال سابقه.
اصل داستان: هر تسک یه خروجی واقعیه : فایل Excel، اسلاید، نقشه CAD، حتی ویدیو و صوت . که برای متوسط حدود ۷ ساعت کار حرفهای زمان میبره. ارزیابی هم با مقایسه زوج بین خروجی مدل و خروجی متخصص انسانی انجام میشه، نه گریدر خودکار.
چارت مدل های برتر تا الان (8/2026) رو توی کامنتا گذاشتم. مدل Claude Opus 5 با ۱۸۳۵ صدرنشینه، بعد GLM-5.3 با ۱۷۶۶ و Grok 4.6 با ۱۷۶۱. بهترین مدلها تقریباً ۸۰٪ بالاتر از سطح متخصص انسانی کار تحویل میدن.
نکتهی جالبتر برای من پراکندگی بالای جدوله: GLM و مدلهای چینی open-weight دیگه کاملاً تو جمع frontier هستن، و فاصلهی رتبه ۱ تا رتبه ۱۰ فقط حدود ۲۰٪ ٪ـه. یعنی دیگه بحث «کدوم مدل به انسان میرسه» نیست؛ بحث اینه که کدوم ارزونتر و سریعتر از انسان تحویل میده.
نکته جالب برای من این بود که چقدر با مهندسی ساده میشه جلو رفت: پرامپتی که مدل رو وادار کنه خروجیش رو بهصورت تصویر رندر کنه و چک کنه، خطاهای فرمت PowerPoint رو از ۸۶٪ به ۶۴٪ رسوند و ۵ واحد درصد هم win rate اضافه کرد.
محدودیتش رو هم بگم: تسکها one-shot و کاملاً مشخصان، در حالی که تو دنیای واقعی فهمیدن خودِ مسئله نصف کاره. کار فیزیکی و دانش ضمنی هم بیرون از دامنهست.
https://arxiv.org/html/2510.04374v1
🛠 Join @LLMEngineers Community
Post #489
1.92K
- 🔥 4
- ❤ 3