TGViewer
هوش مصنوعی و علم داده به فارسی هوش مصنوعی و علم داده به فارسی @dataplusscience · 6.06K subscribers
Post #3556 207
‏📊 تحلیل عملکرد مدل‌های کدنویس از نگاه کاربران

‏در دنیای هوش مصنوعی، علاوه بر بنچمارک‌های استاندارد، «بازخورد کاربران» به یکی از شاخص‌های کلیدی برای درک کیفیت واقعی Agentها تبدیل شده است. تیم Arena.ai با تحلیل بیش از ۲۰ هزار گزارش از عملکرد مدل‌های مختلف، نتایج کاربردی و جالبی استخراج کرده است.

‏مهم‌ترین یافته‌های این تحقیق:

‏- مدل‌های پیشرو (Frontier Models) به شکل معناداری بازخوردهای مثبت بیشتری دریافت می‌کنند و این بهبود کیفیت در نسخه‌های جدیدتر کاملاً مشهود است.
‏- «کد ناقص یا خراب» اصلی‌ترین دلیل نارضایتی کاربران است که نزدیک به ۷۰ درصد از بازخوردهای منفی را شامل می‌شود.
‏- ضعف در تکمیل خروجی‌ها، چالش‌های مربوط به استفاده‌پذیری و نادیده گرفتن دستورالعمل‌های ارسالی از دیگر مشکلات رایج در مدل‌هاست.
‏- اگرچه اکثر مدل‌ها نقاط ضعف مشترکی دارند، اما سطح پایداری و میزان «کد بی‌دقت» (slop) در هر مدل متفاوت است که این موضوع انتخاب بهترین ابزار برای سناریوهای خاص را حساس‌تر می‌کند.

تحلیل دقیق عملکرد مدل‌های کدنویس بر اساس بازخورد واقعی کاربران در Agent Arena

📊 Data➕Science
More from @dataplusscience
  1. Oct 1, 2026‏🤖 عرضه نسخه ۲.۰ پلتفرم Manus با معماری Cascade ‏نسخه جدید Manus از یک ایجنت هوش…
  2. Oct 1, 2026‏🚀 معرفی موتور جستجوی Photon توسط Perplexity ‏جستجو به گلوگاه اصلی برای ایجنت‌های…
  3. Oct 1, 2026‏🤖 معرفی مدل مالتی‌مودال Jev-Omni ‏مدل Jev-Omni به عنوان یک سیستم جامع چندوجهی من…
  4. Oct 1, 2026‏🦴 انتشار مدل‌های بنیادی سه‌بعدی برای رادیولوژی ‏مدل‌های nnFoundation به عنوان مد…
  5. Oct 1, 2026‏🧠 گوگل دیپ‌مایند مدل جدید Gemini 4 Argon را معرفی کرد ‏شرکت گوگل دیپ‌مایند از مد…
  6. Sep 30, 2026‏📊 الگوهای طراحی در یادگیری ماشین ‏کتاب Machine Learning Design Patterns مجموعه‌ا…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →