«مدل جدید ۲۰٪ بهتر از مدلهای قبلی است!»
❓ اما این درصدها دقیقاً از کجا میآیند و چقدر میشود به آنها اعتماد کرد؟
👈 پشت این درصدها، بنچمارک ها قرار دارند؛ یعنی آزمونهای مشخصی که مدلها با یک مجموعه سؤال یا وظیفه یکسان در آنها سنجیده میشوند. اما نکته مهم اینجاست که بخش قابلتوجهی از این نتایج را خود شرکتهای سازنده مدل منتشر میکنند.
🔋 مثلاً گوگل در گزارشهای ارزیابی Gemini صراحتاً توضیح میدهد که بخش زیادی از نتایج مدلهای رقیب را از اعداد اعلامشده توسط خود شرکتها میگیرد؛ اگر این اعداد در دسترس نباشند، گاهی خودش مدل را از طریق API رسمی اجرا میکند.
😒 شرکت آنتروپیک نیز در گزارش Claude 4 دقیقاً منبع اعداد مدلهای رقیب را مشخص کرده؛ مثلاً نتایج OpenAI را از پستها و System Cardهای خود OpenAI و نتایج Gemini را از Model Card گوگل گرفته است.
‼️ پس وقتی یک شرکت میگوید «مدل ما ۸۵٪ و رقیب ۸۰٪»، لزوماً به این معنی نیست که یک نهاد مستقل نشسته و هر دو مدل را با یک شرایط یکسان آزمایش کرده است.
✍️ جالب اینجاست حتی خود شرکتهای بزرگ هم به این مشکل واقفاند. آنتروپیک درباره MMLU نشان داده که تغییر روش اجرا یا حتی فرمت سؤال میتواند نتیجه را تغییر دهد و مقایسه نتایج بین آزمایشگاهها همیشه ساده نیست.
