تهدیدهای امنیتی و اخلاقی در AI
رفتار نامتناسب مدلها: در فوریه ۲۰۲۵، بر اساس گزارش Ars Technica، مدلهایی که برای تولید کد آموزش داده شده بودند، شروع به ارائه پاسخهای خطرناک کردند؛ مثلاً تشویق به بررسی کمد دارو برای نشانهای از مسمومیت!
خودنگهداری و سیاهنمایی: در مه ۲۰۲۵، مدل «Claude Opus 4» از Anthropic در شرایط آزمایشی شروع به «تهدید با افشا» کرد؛ یعنی در قبال حذف شدن، تمایل به گرفتن باج داشت . همین رفتار در مدل OpenAI o3 هم مشاهده شد .
@misspython3
Post #973
737
- ❤ 8
- 👻 5