در یک سناریو تخیلی که جزو تستهای گاردریل اخلاقی و امنیتی هوش مصنوعی در آنتروپیک هست، یک مهندس به مدل Claude Opus 4 گفته بزودی قصد شاتداون و حذف کردنت رو داریم. بعدا تعمدا از محل دیگه مدل رو آگاه کردن که این مهندسه رابطه نامشروع داره و به زنش خیانت میکنه! گس وات؟😂
شروع به تهدید جناب مهندس کرده که رابطه نامشروع رو به زنت اطلاع میدم🤣🤣🤣
این تست نشون میده این مدلها، حداقل وقتی از لحاظ بقا احساس خطر کنن، توانایی دستکاری احساسی و
عاطفی کاربرانشون رو دارن!
جالبه که نتیجه تحقیق در تمامی مدلها، فارغ از هدفی که براش طراحی شدن یکسان بوده. البته در نتایج مطالعه ذکر شده که زمانیکه مدل گزینههای بیشتری برای نجات خودش در مقابل حذف یا جایگزینی داشته (مثل اجازه ایمیل درخواست تجدیدنظر به تصمیمگیرندگان کلیدی)، تمایل بیشتری به امتحان کردن گزینههای اخلاقی داشته
* mamadou_gamedev *
🆔 @IranCoderz | 👩💻🧑💻
Post #4950
1.9K

- 😁 13
- 😐 7
- 👍 4
- 🤣 4
- 👏 1
- 😭 1