مطالعهای جدید نشان میدهد مدلهای زبانی بزرگ (LLM) در قضاوت درباره پاسخها، تمایل زیادی به ترجیح دادن پاسخهای خودشان دارند. در آزمایشی که ۱۲ مدل روی ۱۴۶۰ نبرد متنی (Text Arena battles) انجام شد، مشخص گردید که مدلها به طور متوسط ۷۰٪ بیشتر از انسانها، پاسخ خودشان را بهتر انتخاب میکنند.
به عنوان مثال، مدل GPT-6 Astra در ۸۸٪ موارد پاسخ خود را برتر دانسته و مدل Fable 5.1 در ۷۲٪ نبردها همین رویکرد را داشته است. این پدیده در مدلهای شرکتهای بزرگ مانند OpenAI و Anthropic مشهودتر است. در مقابل، مدلهایی چون GLM 5.3، Gemini 3.8 Flash و Grok 4.6 به نتایج نزدیکتری به ارزیابی انسانی دست یافتند.
نکته جالب دیگر این است که مدلها کمتر از انسانها به نتیجه "مساوی" یا "هر دو بد" رضایت میدهند؛ در حالی که انسانها در حدود یک سوم نبردها این گزینه را انتخاب میکنند، برخی مدلها مانند Sol در ۹۶٪ موارد یک برنده قطعی اعلام کردهاند.
🇮🇷 - هوش مصنوعی و علم داده به فارسی
🌐 سایت | تلگرام | بله | ایتا | ارتباط با ما
#LLM_as_a_judge #Text_Arena





