TGViewer
AI Pulse AI Pulse @aipulse24 · 3.33K subscribers
Post #443 2.86K
یه مقاله‌ی تازه از تیم تحقیقاتی Cohere، دانشگاه‌های استنفورد، MIT و AI2، سازمان LM Arena رو متهم کرده که شرایطی فراهم کرده تا چند شرکت خاص هوش مصنوعی، از جمله Meta، OpenAI، Google و Amazon، امتیازهای بهتری در پلتفرم معروف Chatbot Arena کسب کنن.

طبق این مقاله، شرکت‌هایی مثل Meta تونستن نسخه‌های مختلفی از مدل‌هاشون رو به‌صورت خصوصی توی این پلتفرم آزمایش کنن، ولی فقط نتایج مدل‌هایی که خوب عمل کرده بودن منتشر شده. این یعنی بدون اینکه بقیه شرکت‌ها از این فرصت بهره‌مند باشن، چند شرکت خاص تونستن مدل بهتری ارائه بدن و جایگاه بالاتری توی جدول رتبه‌بندی بگیرن.

‏Chatbot Arena که سال ۲۰۲۳ به‌عنوان یه پروژه‌ی تحقیقاتی از دانشگاه UC Berkeley شروع شد، به‌سرعت تبدیل شده به یکی از معیارهای محبوب برای مقایسه مدل‌های هوش مصنوعی. شیوه‌ی کارش این‌طوریه که دو مدل کنار هم قرار می‌گیرن، کاربر یکی رو انتخاب می‌کنه و رای‌ها در طول زمان امتیاز نهایی مدل رو مشخص می‌کنن.

با این حال، مقاله می‌گه برخلاف ادعای بی‌طرف بودن LM Arena، شرکت Meta بین ژانویه تا مارس، ۲۷ مدل مختلف رو به‌صورت خصوصی تست کرده ولی در نهایت فقط امتیاز یه مدل قوی رو منتشر کرده — همونی که بعداً در صدر جدول قرار گرفت.

‏LM Arena توی جوابیه‌ای که برای TechCrunch فرستاده، مقاله رو پر از "اشتباه" و "تحلیل‌های مشکوک" دونسته و گفته که امکان تست برای همه‌ی شرکت‌ها بازه و اگه شرکتی تست بیشتری انجام داده، به این معنی نیست که بقیه ناعادلانه برخورد شدن. با این حال، نویسنده‌های مقاله می‌گن این سطح از دسترسی فقط به تعداد محدودی شرکت اطلاع داده شده بوده.

نویسنده‌های مقاله که از نوامبر ۲۰۲۴ شروع به بررسی داده‌ها کردن، می‌گن بیش از ۲.۸ میلیون نبرد بین مدل‌ها رو در طول پنج ماه تحلیل کردن و به این نتیجه رسیدن که بعضی شرکت‌ها نه‌تنها بیشتر تونستن مدل تست کنن، بلکه مدل‌هاشون هم بیشتر وارد رقابت شده‌ن و داده‌های بیشتری جمع کردن — چیزی که به مدل‌ها توی تمرین و بهبود عملکرد کمک کرده.

در حالی‌که بعضی از اطلاعات مقاله با تکیه بر «خوداظهاری» مدل‌ها درباره اینکه ساخت کدوم شرکت‌ان جمع‌آوری شده (که روش دقیقی نیست)، سارا هوکر می‌گه وقتی یافته‌های اولیه با LM Arena به اشتراک گذاشته شده، اونا مخالفتی نکردن.

در پایان، نویسنده‌های مقاله از LM Arena خواستن تغییراتی در روند خودش ایجاد کنه؛ از جمله اینکه سقف مشخصی برای تست‌های خصوصی تعیین بشه، نتایج این تست‌ها به‌صورت عمومی منتشر بشه و نرخ نمایش مدل‌ها توی نبردها برای همه‌ی شرکت‌ها یکسان بشه. LM Arena بعضی از این پیشنهادها رو پذیرفته، اما گفته منتشر کردن امتیاز مدل‌هایی که هنوز عرضه نشدن، منطقی نیست.

این مقاله در حالی منتشر شده که Meta چند هفته پیش هم بابت دستکاری رتبه‌ها در زمان عرضه‌ی Llama 4 خبرساز شده بود. حالا هم LM Arena اعلام کرده قراره شرکت راه بندازه و سرمایه جذب کنه — موضوعی که پرسش‌های تازه‌ای درباره‌ی استقلال و شفافیت این سازمان مطرح می‌کنه.

نسخه کامل این مقاله رو میتونید از اینجا دانلود و مشاهده کنید.

@aipulse24
  • 👍 17
  • ❤ 5
  • 💔 2
More from @aipulse24
  1. Dec 28, 2025امار امسال کانال با تشکر ویژه از اسپانسر اصلی ما کانال تک تیوب:)) و محمد با پست های فوق ال…
  2. Dec 21, 2025کافیه 🎁 رو توی یک چت جدید توی ChatGPT وارد کنید (بدون هیچ متنی) تا به صورت اتوماتیک بعد ا…
  3. Dec 11, 2025گوگل به‌تازگی از یک مرورگر آزمایشی و متفاوت به نام «دیسکو» (Disco) رونمایی کرده که قرار نی…
  4. Nov 27, 2025بلک فارست لبز به تازگی از خانواده جدید مدل‌های تصویرساز خودش یعنی Flux 2 رونمایی کرده که پ…
  5. Nov 20, 2025تصویر ساخته شده توسط یکی از اعضای کانال. تکست رندرینگ و consistency مدل شگفت انگیزه. @aipu…
  6. Nov 20, 2025مدل جدید Nano Banana Pro به گوگل اسلایدز هم رسیده و الان میتونید ازش بخواید تا اسلاید هاتو…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →