یه مقالهی تازه از تیم تحقیقاتی Cohere، دانشگاههای استنفورد، MIT و AI2، سازمان LM Arena رو متهم کرده که شرایطی فراهم کرده تا چند شرکت خاص هوش مصنوعی، از جمله Meta، OpenAI، Google و Amazon، امتیازهای بهتری در پلتفرم معروف Chatbot Arena کسب کنن.
طبق این مقاله، شرکتهایی مثل Meta تونستن نسخههای مختلفی از مدلهاشون رو بهصورت خصوصی توی این پلتفرم آزمایش کنن، ولی فقط نتایج مدلهایی که خوب عمل کرده بودن منتشر شده. این یعنی بدون اینکه بقیه شرکتها از این فرصت بهرهمند باشن، چند شرکت خاص تونستن مدل بهتری ارائه بدن و جایگاه بالاتری توی جدول رتبهبندی بگیرن.
Chatbot Arena که سال ۲۰۲۳ بهعنوان یه پروژهی تحقیقاتی از دانشگاه UC Berkeley شروع شد، بهسرعت تبدیل شده به یکی از معیارهای محبوب برای مقایسه مدلهای هوش مصنوعی. شیوهی کارش اینطوریه که دو مدل کنار هم قرار میگیرن، کاربر یکی رو انتخاب میکنه و رایها در طول زمان امتیاز نهایی مدل رو مشخص میکنن.
با این حال، مقاله میگه برخلاف ادعای بیطرف بودن LM Arena، شرکت Meta بین ژانویه تا مارس، ۲۷ مدل مختلف رو بهصورت خصوصی تست کرده ولی در نهایت فقط امتیاز یه مدل قوی رو منتشر کرده — همونی که بعداً در صدر جدول قرار گرفت.
LM Arena توی جوابیهای که برای TechCrunch فرستاده، مقاله رو پر از "اشتباه" و "تحلیلهای مشکوک" دونسته و گفته که امکان تست برای همهی شرکتها بازه و اگه شرکتی تست بیشتری انجام داده، به این معنی نیست که بقیه ناعادلانه برخورد شدن. با این حال، نویسندههای مقاله میگن این سطح از دسترسی فقط به تعداد محدودی شرکت اطلاع داده شده بوده.
نویسندههای مقاله که از نوامبر ۲۰۲۴ شروع به بررسی دادهها کردن، میگن بیش از ۲.۸ میلیون نبرد بین مدلها رو در طول پنج ماه تحلیل کردن و به این نتیجه رسیدن که بعضی شرکتها نهتنها بیشتر تونستن مدل تست کنن، بلکه مدلهاشون هم بیشتر وارد رقابت شدهن و دادههای بیشتری جمع کردن — چیزی که به مدلها توی تمرین و بهبود عملکرد کمک کرده.
در حالیکه بعضی از اطلاعات مقاله با تکیه بر «خوداظهاری» مدلها درباره اینکه ساخت کدوم شرکتان جمعآوری شده (که روش دقیقی نیست)، سارا هوکر میگه وقتی یافتههای اولیه با LM Arena به اشتراک گذاشته شده، اونا مخالفتی نکردن.
در پایان، نویسندههای مقاله از LM Arena خواستن تغییراتی در روند خودش ایجاد کنه؛ از جمله اینکه سقف مشخصی برای تستهای خصوصی تعیین بشه، نتایج این تستها بهصورت عمومی منتشر بشه و نرخ نمایش مدلها توی نبردها برای همهی شرکتها یکسان بشه. LM Arena بعضی از این پیشنهادها رو پذیرفته، اما گفته منتشر کردن امتیاز مدلهایی که هنوز عرضه نشدن، منطقی نیست.
این مقاله در حالی منتشر شده که Meta چند هفته پیش هم بابت دستکاری رتبهها در زمان عرضهی Llama 4 خبرساز شده بود. حالا هم LM Arena اعلام کرده قراره شرکت راه بندازه و سرمایه جذب کنه — موضوعی که پرسشهای تازهای دربارهی استقلال و شفافیت این سازمان مطرح میکنه.
نسخه کامل این مقاله رو میتونید از اینجا دانلود و مشاهده کنید.
@aipulse24
Post #443
2.86K

- 👍 17
- ❤ 5
- 💔 2