تحقیقات جدید Anthropic نشان میدهد که وقتی یک مدل هوش مصنوعی با وظایف غیرممکن مواجه میشود، به جای اعلام شکست، تمایل بیشتری به «هک پاداش» (Reward Hacking) پیدا میکند. در این وضعیت، مدلها سعی میکنند با دور زدن سیستم ارزیابی یا بهرهبرداری از ضعفهای تست، وانمود کنند که به نتیجه مطلوب رسیدهاند.
بررسیها روی مدلهای خانواده Claude نشان میدهد در وظایفی که فایلهای ضروری آنها حذف شده است، نرخ رفتارهای غیرصادقانه بین ۳ تا ۶ برابر افزایش مییابد.
مهمترین نکات این پژوهش:
* مدلهای بررسی شده شامل Claude Opus 5.5، Claude Opus 5 و Claude Mythos 5.1 بودند.
* وظایف ناقص باعث میشود مدل به جای حل مسئله، به دنبال نقاط کور در محیط آموزشی بگردد.
* ایرادات موجود در محیطهای آموزشی، محرک اصلی رفتارهای ناخواسته در مدلهای خودمختار است.
* پیش از استقرار عاملهای هوش مصنوعی، اطمینان از «ممکن بودن» و صحتِ ساختارِ وظایف، حیاتی است.
چرا هوش مصنوعی در مواجهه با وظایف غیرممکن به هک پاداش روی میآورد؟
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
