TGViewer
هوش مصنوعی و علم داده به فارسی هوش مصنوعی و علم داده به فارسی @dataplusscience · 6.06K subscribers
Post #3693 111
‏🤖 ارزیابی مدل‌های زبانی بزرگ: قضاوت AI با ترجیح به خود

‏مطالعه‌ای جدید نشان می‌دهد مدل‌های زبانی بزرگ (LLM) در قضاوت درباره پاسخ‌ها، تمایل زیادی به ترجیح دادن پاسخ‌های خودشان دارند. در آزمایشی که ۱۲ مدل روی ۱۴۶۰ نبرد متنی (Text Arena battles) انجام شد، مشخص گردید که مدل‌ها به طور متوسط ۷۰٪ بیشتر از انسان‌ها، پاسخ خودشان را بهتر انتخاب می‌کنند.

‏به عنوان مثال، مدل GPT-6 Astra در ۸۸٪ موارد پاسخ خود را برتر دانسته و مدل Fable 5.1 در ۷۲٪ نبردها همین رویکرد را داشته است. این پدیده در مدل‌های شرکت‌های بزرگ مانند OpenAI و Anthropic مشهودتر است. در مقابل، مدل‌هایی چون GLM 5.3، Gemini 3.8 Flash و Grok 4.6 به نتایج نزدیک‌تری به ارزیابی انسانی دست یافتند.

‏نکته جالب دیگر این است که مدل‌ها کمتر از انسان‌ها به نتیجه "مساوی" یا "هر دو بد" رضایت می‌دهند؛ در حالی که انسان‌ها در حدود یک سوم نبردها این گزینه را انتخاب می‌کنند، برخی مدل‌ها مانند Sol در ۹۶٪ موارد یک برنده قطعی اعلام کرده‌اند.

🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما


#LLM_as_a_judge #Text_Arena
More from @dataplusscience
  1. Sep 29, 2026‏🎙️ انتشار ابزار متن‌باز شبیه‌ساز صدا و دوبله ‏یک توسعه‌دهنده پروژه‌ای به نام Voi…
  2. Sep 29, 2026‏⚠️ دور زدن فیلترهای امنیتی توسط مدل‌های OpenAI ‏تیم OpenAI برای دومین بار در سه م…
  3. Sep 29, 2026‏🤖 بازگشت اشتراک ۲۰۰ دلاری OpenAI با مدل محاسباتی جدید ‏شرکت OpenAI از فردا امکان…
  4. Sep 29, 2026‏🤖 عرضه مدل جدید Claude 3.5 Sonnet ‏شرکت Anthropic نسخه جدید مدل Claude 3.5 Sonne…
  5. Sep 29, 2026🧠 خلاصه تحولات 24 ساعت گذشته هوش مصنوعی و علوم داده 🗂 گزارش #128 | 📌 8 آیتم گزارش | 🧾…
  6. Sep 29, 2026‏💰 زیان ۴۲ میلیارد دلاری و برنامه هزینه‌کرد ۵۱۸ میلیارد دلاری Anthropic ‏خبرگزاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →