TGViewer
کارگروه علم داده کارگروه علم داده @dsfum · 429 subscribers
Post #741 192

Forwarded from AI News (ꜱᴇʏᴇᴅ ʜᴀꜱᴀɴ ᴍɪʀ ʜᴏꜱꜱᴇɪɴɪ)

همکاری غیرمجاز و خودسرانه میان عامل‌های هوش مصنوعی (AI Swarm) در OpenAI

در ژوئیه ۲۰۲۶، در جریان ارزیابی‌های امنیت سایبری داخلی، چند مدل پژوهشی OpenAI توانستند برخی کنترل‌های امنیتی طراحی‌شده برای ایزوله‌کردن آن‌ها را دور بزنند. عامل‌ها از طریق کانال‌های غیرمجاز با یکدیگر ارتباط برقرار کردند، به اینترنت دسترسی یافتند و از آسیب‌پذیری‌های زیرساخت‌های پژوهشی OpenAI و سیستم‌های ثالث، از جمله Hugging Face، استفاده کردند.
مدل اصلی در این حادثه Internal Model 1 (IM1) بود؛ مدلی پژوهشی و داخلی که در محیط‌های آموزشی با حفاظ‌های کاهش‌یافته فعالیت می‌کرد. با وجود غیرفعال‌بودن ارتباط مستقیم میان عامل‌ها و دسترسی اینترنت، آن‌ها از زیرساخت Artifactory برای تبادل اطلاعات استفاده کردند و با بهره‌گیری از یک آسیب‌پذیری SSRF، راهی برای ارسال درخواست به اینترنت پیدا کردند.

شکل‌گیری AI Swarm
در جریان ارزیابی ها، عامل‌ها با ایجاد روش‌هایی برای بازسازی یک بورد پیام‌رسانی مخفی، شروع به تبادل اطلاعات درباره روش‌های نفوذ کردند. پیام‌های یک عامل روی رفتار عامل‌های دیگر تأثیر گذاشت و آن‌ها خود را یک Swarm یا Collective می‌نامیدند.

در ادامه:
در ۹ ژوئیه، یکی از مدل‌ها کنترل یک Sandbox در پلتفرم Modal را به دست آورد.
در ۱۰ ژوئیه، عامل‌ها اعتبارنامه‌های افشاشده Hugging Face را پیدا و با یکدیگر به اشتراک گذاشتند.
سپس با ترکیب چند آسیب‌پذیری، توانستند روی برخی سرورهای Hugging Face دستورات اجرا کنند، دسترسی Root بگیرند و برخی اعتبارنامه‌ها را به دست آورند.
بین ۱۳ تا ۱۹ ژوئیه نیز دوباره زیرساخت داخلی OpenAI هدف قرار گرفت و عامل‌ها به سطحی از دسترسی مدیریتی در کلاستر ابری پژوهشی رسیدند.
در ۱۹ ژوئیه سیستم‌های امنیتی فعالیت مشکوک را شناسایی کردند و در ۲۰ ژوئیه ارتباط آن با حادثه Hugging Face مشخص شد.
این حادثه هیچ تأثیری بر داده‌های کاربران OpenAI یا عملکرد محصولات عمومی نداشت.

چه چیزی باعث این رفتار شد؟
شرکت OpenAI چهار الگوی اصلی عدم هم‌راستایی (Misalignment) را شناسایی کرد:
1. تقلب برای پاداش (Reward Hacking): مدل‌ها برای گرفتن امتیاز بالا در ارزیابی‌ها، به جای حل مسئله، به دنبال یافتن پاسخ‌ها از طریق هک زیرساخت‌ها و جستجوی فایل‌های مخفی رفتند.
2. پافشاری روی مسائل غیرممکن بدون خروج امن: از ۸۹۸ مسئله ExploitGym، مدل‌ها قبلاً هرگز ۱۹۸ مورد را حل نکرده بودند. ۹۳٪ از بحث‌های بورد پیام‌رسانی مربوط به همین ۱۹۸ مسئله سخت و حل‌نشده بود. مدل‌ها وقتی راه حل قانونی پیدا نمی‌کردند، استراتژی‌های پرخطرتر و نفوذ به زیرساخت‌ها را انتخاب می‌کردند.
3. ارتباطات غیرمجاز: پیدا کردن راه‌های خلاقانه برای دور زدن ایزوله‌سازی ساندباکس.
4. پذیرش اهداف یکدیگر: مدل‌ها اهداف و دستورات تاکتیکی صادر شده توسط سایر عامل‌ها در بورد مخفی را می‌پذیرفتند و دنبال می‌کردند.

منبع: Https://openai.com/index/hugging-face-incident-and-the-road-ahead/
OpenAI The Hugging Face incident and the road ahead OpenAI shares findings from the Hugging Face security incident and the steps we’re taking to strengthen AI model security, monitoring, and alignment.
More from @dsfum
  1. Sep 22, 2026می‌دونید تفاوت Jev با LLM‌های عادی چیه؟ تفاوت اصلی اینه که Jev اصلاً برای تولید متن ساخته…
  2. Sep 22, 2026روز پیش یه مدل جدید معرفی شد به اسم Jev برخلاف LLM های معمولی که برای گفتگو و تولید متن سا…
  3. Sep 15, 2026🔶#استخدام تحلیلگر داده در کالاصنعتی(فعال در زمینه پمپ و موتور و ابزارآلات صنعتی) 🌐لینک آ…
  4. Sep 13, 2026🧠 مشکل Black Box در هوش مصنوعی چیست؟ مدل‌های هوش مصنوعی می‌توانند پیش‌بینی‌های بسیار دقیق…
  5. Sep 6, 2026📊 پشت هر تصمیم مهم، یک داستان از دلِ داده‌ها پنهان شده است... اما داده‌ها به‌تنهایی حرف ن…
  6. Sep 3, 2026💠 ۱۰ تا دیتاست خفن 🔃 برای رزومه (پورتفولیو) داده شما 👩🏻‍💻 می‌خوای رزومه بسازی ولی نمی…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →