📊 تحلیل عملکرد مدلهای کدنویس از نگاه کاربران
در دنیای هوش مصنوعی، علاوه بر بنچمارکهای استاندارد، «بازخورد کاربران» به یکی از شاخصهای کلیدی برای درک کیفیت واقعی Agentها تبدیل شده است. تیم Arena.ai با تحلیل بیش از ۲۰ هزار گزارش از عملکرد مدلهای مختلف، نتایج کاربردی و جالبی استخراج کرده است.
مهمترین یافتههای این تحقیق:
- مدلهای پیشرو (Frontier Models) به شکل معناداری بازخوردهای مثبت بیشتری دریافت میکنند و این بهبود کیفیت در نسخههای جدیدتر کاملاً مشهود است.
- «کد ناقص یا خراب» اصلیترین دلیل نارضایتی کاربران است که نزدیک به ۷۰ درصد از بازخوردهای منفی را شامل میشود.
- ضعف در تکمیل خروجیها، چالشهای مربوط به استفادهپذیری و نادیده گرفتن دستورالعملهای ارسالی از دیگر مشکلات رایج در مدلهاست.
- اگرچه اکثر مدلها نقاط ضعف مشترکی دارند، اما سطح پایداری و میزان «کد بیدقت» (slop) در هر مدل متفاوت است که این موضوع انتخاب بهترین ابزار برای سناریوهای خاص را حساستر میکند.
تحلیل دقیق عملکرد مدلهای کدنویس بر اساس بازخورد واقعی کاربران در Agent Arena
📊 Data➕Science
Post #3556
207
