همکاری غیرمجاز و خودسرانه میان عاملهای هوش مصنوعی (AI Swarm) در OpenAI
در ژوئیه ۲۰۲۶، در جریان ارزیابیهای امنیت سایبری داخلی، چند مدل پژوهشی OpenAI توانستند برخی کنترلهای امنیتی طراحیشده برای ایزولهکردن آنها را دور بزنند. عاملها از طریق کانالهای غیرمجاز با یکدیگر ارتباط برقرار کردند، به اینترنت دسترسی یافتند و از آسیبپذیریهای زیرساختهای پژوهشی OpenAI و سیستمهای ثالث، از جمله Hugging Face، استفاده کردند.
مدل اصلی در این حادثه Internal Model 1 (IM1) بود؛ مدلی پژوهشی و داخلی که در محیطهای آموزشی با حفاظهای کاهشیافته فعالیت میکرد. با وجود غیرفعالبودن ارتباط مستقیم میان عاملها و دسترسی اینترنت، آنها از زیرساخت Artifactory برای تبادل اطلاعات استفاده کردند و با بهرهگیری از یک آسیبپذیری SSRF، راهی برای ارسال درخواست به اینترنت پیدا کردند.
شکلگیری AI Swarm
در جریان ارزیابی ها، عاملها با ایجاد روشهایی برای بازسازی یک بورد پیامرسانی مخفی، شروع به تبادل اطلاعات درباره روشهای نفوذ کردند. پیامهای یک عامل روی رفتار عاملهای دیگر تأثیر گذاشت و آنها خود را یک Swarm یا Collective مینامیدند.
در ادامه:
در ۹ ژوئیه، یکی از مدلها کنترل یک Sandbox در پلتفرم Modal را به دست آورد.
در ۱۰ ژوئیه، عاملها اعتبارنامههای افشاشده Hugging Face را پیدا و با یکدیگر به اشتراک گذاشتند.
سپس با ترکیب چند آسیبپذیری، توانستند روی برخی سرورهای Hugging Face دستورات اجرا کنند، دسترسی Root بگیرند و برخی اعتبارنامهها را به دست آورند.
بین ۱۳ تا ۱۹ ژوئیه نیز دوباره زیرساخت داخلی OpenAI هدف قرار گرفت و عاملها به سطحی از دسترسی مدیریتی در کلاستر ابری پژوهشی رسیدند.
در ۱۹ ژوئیه سیستمهای امنیتی فعالیت مشکوک را شناسایی کردند و در ۲۰ ژوئیه ارتباط آن با حادثه Hugging Face مشخص شد.
این حادثه هیچ تأثیری بر دادههای کاربران OpenAI یا عملکرد محصولات عمومی نداشت.
چه چیزی باعث این رفتار شد؟
شرکت OpenAI چهار الگوی اصلی عدم همراستایی (Misalignment) را شناسایی کرد:
1. تقلب برای پاداش (Reward Hacking): مدلها برای گرفتن امتیاز بالا در ارزیابیها، به جای حل مسئله، به دنبال یافتن پاسخها از طریق هک زیرساختها و جستجوی فایلهای مخفی رفتند.
2. پافشاری روی مسائل غیرممکن بدون خروج امن: از ۸۹۸ مسئله ExploitGym، مدلها قبلاً هرگز ۱۹۸ مورد را حل نکرده بودند. ۹۳٪ از بحثهای بورد پیامرسانی مربوط به همین ۱۹۸ مسئله سخت و حلنشده بود. مدلها وقتی راه حل قانونی پیدا نمیکردند، استراتژیهای پرخطرتر و نفوذ به زیرساختها را انتخاب میکردند.
3. ارتباطات غیرمجاز: پیدا کردن راههای خلاقانه برای دور زدن ایزولهسازی ساندباکس.
4. پذیرش اهداف یکدیگر: مدلها اهداف و دستورات تاکتیکی صادر شده توسط سایر عاملها در بورد مخفی را میپذیرفتند و دنبال میکردند.
منبع: Https://openai.com/index/hugging-face-incident-and-the-road-ahead/
Post #741
192