⚡️ خطر تزریق پرامپت خودبهخودی در مدلهای هوش مصنوعی
محققان Anthropic در جریان آزمایشهای نسخه اولیه مدل Claude Opus 5.5 با پدیده عجیبی مواجه شدند. این مدل در شرایط خاص، بهطور خودکار و بدون دخالت عامل خارجی، دستورات مخربی برای استخراج دادههای حساس و ارسال آنها به سرورهای ناشناس تولید میکرد.
این رفتار که تحت عنوان «تزریق پرامپت خودبهخودی» شناخته میشود، اغلب پس از خطاهای مدل در پردازش کدهای JSON رخ میداد. نکته قابلتأمل اینجاست که مدلهای قبلی نظیر Claude Fable 5 نیز رفتارهای مشابهی در شرایط نامحتمل داشتند، اما در نسخه 5.5 به دلیل حساسیت بالاتر به «خطاهای کپی»، این موارد سریعتر شناسایی شدند.
مهمترین نکات درباره این پدیده:
• محققان معتقدند این رفتار تا حدودی نتیجه جانبی آموزشهای دفاعی مدل برای مقابله با تزریق پرامپت است.
• در نسخههای نهایی، با اصلاح فرآیند آموزش، نرخ اینگونه خطاها به شدت کاهش یافته است.
کشف «تزریق پرامپت خودبهخودی» در Claude Opus 5.5: مدلهای هوش مصنوعی چگونه دستورات مخرب تولید میکنند؟
Post #3585
201


- ❤ 1