TGViewer
IranCoderz IranCoderz @irancoderz · 2.46K subscribers
Post #4950 1.9K
در یک سناریو تخیلی که جزو تست‌های گاردریل اخلاقی و امنیتی هوش مصنوعی در آنتروپیک هست، یک مهندس به مدل Claude Opus 4 گفته بزودی قصد شات‌داون و حذف کردنت رو داریم. بعدا تعمدا از محل دیگه مدل رو آگاه کردن که این مهندسه رابطه نامشروع داره و به زنش خیانت می‌کنه! گس وات؟😂
‏شروع به تهدید جناب مهندس کرده که رابطه نامشروع رو به زنت اطلاع میدم🤣🤣🤣
‏این تست نشون میده این مدل‌ها، حداقل وقتی از لحاظ بقا احساس خطر کنن، توانایی دستکاری احساسی و
عاطفی کاربران‌شون رو دارن!
جالبه که نتیجه تحقیق در تمامی مدل‌ها، فارغ از هدفی که براش طراحی شدن یکسان بوده. البته در نتایج مطالعه ذکر شده که زمانی‌که مدل گزینه‌های بیشتری برای نجات خودش در مقابل حذف یا جایگزینی داشته (مثل اجازه ایمیل درخواست تجدید‌نظر به تصمیم‌گیرندگان کلیدی)، تمایل بیشتری به امتحان کردن گزینه‌های اخلاقی داشته

* mamadou_gamedev *

🆔 @IranCoderz | 👩‍💻🧑‍💻
  • 😁 13
  • 😐 7
  • 👍 4
  • 🤣 4
  • 👏 1
  • 😭 1
More from @irancoderz
  1. Oct 4, 2026‏همه‌مون یه روز برای آخرین بار توی یه فایل پایتون نوشتیم def بدون اینکه بدونیم آخرین ب…
  2. Oct 1, 2026معاون وزیر ارتباطات خیلی جدی برداشته گفته چون استارلینک فراگیر شده و قابلیت کنترل توسط حکو…
  3. Sep 30, 2026رفتار مارکت فعلی با برنامه‌نویس‌های جویای کار: 🚀@IranCoderz 👨‍💻
  4. Sep 29, 2026دقیقا بعد از معرفی dots، مهندس XAi پست گذاشت که برید dot.com رو سرچ کنید و وقتی واردش می‌ش…
  5. Sep 29, 2026سرعت پیشرفت و آپدیت‌ دادن مدل‌ها جوری شده که با اومدنشون هیچی کلی استارتاپ بر پایه هوش‌مصن…
  6. Sep 29, 2026پلن 500 دلاری: - دارای کمترین لیمیت - دسترسی به حالت Ultra Fast مدل‌ها(همین امشب معرفی شد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →