TGViewer
TryHackBox ( AI Security ) TryHackBox ( AI Security ) @aithb · 1.51K subscribers
Post #342 606
نفوذ غیرمستقیم از طریق مسموم‌سازی corpus در سیستم‌های عاملی RAG-محور

در سیستم‌های هوش مصنوعی مبتنی بر معماری RAG که در بستر عاملی عمل می‌کنند، یک سطح حمله‌ی غیربدیهی وجود دارد که در اکثر ارزیابی‌های امنیتی متداول نادیده گرفته می‌شود. این بردار از یک ضعف ساختاری در نحوه‌ی پردازش بازیابی‌شده‌های معنایی توسط لایه‌ی تولید بهره‌برداری می‌کند.

مکانیزم بنیادی بدین شرح است: مهاجم با تزریق محتوای دستکاری‌شده به corpus اولیه، توزیع بردارهای embedding را به‌گونه‌ای تغییر می‌دهد که شباهت کسینوسی میان chunk مخرب و query‌های هدف در فضای latent بیشینه شود. در نتیجه، سیستم RAG این محتوا را با بالاترین رتبه بازیابی کرده و به‌عنوان context معتبر به مدل زبانی تحویل می‌دهد.

آنچه این حمله را از prompt injection ساده متمایز می‌کند، لایه‌ی دوم آن است — و این همان نقطه‌ای است که اکثر سیستم‌های تشخیص در آن شکست می‌خورند. محتوای مخرب یک دستور اجرایی صریح نیست؛ بلکه یک ساختار معنایی است که مدل آن را با توجه به توزیع احتمالاتی توکن‌هایش به‌عنوان بخشی طبیعی از جریان استدلال تفسیر می‌کند.

در معماری‌های عاملی با دسترسی به ابزار — وب‌سرچ، اجرای کد، API — این تفسیر اشتباه می‌تواند به اجرای دستوراتی منجر شود که هرگز توسط کاربر اصلی صادر نشده‌اند. در سیستم‌هایی با reflection loop یا multi-step planning، اثر این حمله در هر چرخه تشدید می‌شود؛ پدیده‌ای که می‌توان آن را «تجمع drift استدلالی» نامید.

نکته‌ای با ابهام عمدی: تکنیک‌های reranking مبتنی بر cross-encoder می‌توانند این بردار را تا حدی محدود کنند، اما در شرایطی که مهاجم به توزیع embedding مدل دسترسی دارد — حتی به‌صورت black-box از طریق membership inference — این سد قابل دور زدن است. جزئیات این مرحله خارج از حوزه‌ی این نوشتار است.

برای تیم‌های دفاعی: اعتبارسنجی یکپارچگی corpus پیش از indexing، جداسازی کامل pipeline بازیابی از pipeline اجرایی عامل، و anomaly detection روی الگوهای attention در لایه‌های پایانی — سه لایه‌ی ضروری هستند. نه کافی.

@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
  • 👍 1
More from @aithb
  1. Sep 27, 2026TryHackBox #CTF #1 سطح : خیلی آسان یه چالش امنیت سایبری آماده کردیم! دو فایل زیر رو دانلود…
  2. Sep 27, 2026🎯 Resource Development در AI Red Team: نقشه‌ی دقیق روی MITRE ATLAS** 1. 🎯 Resource Devel…
  3. Sep 26, 2026🧩 گاهی اوقات، مجرمان سایبری تمایل دارند که دستگیر شوند. بیایید یک مثال دیگر و ابزاری را ب…
  4. Sep 22, 2026📌 بررسی امنیتی مدل «Zero Trust» برای عوامل هوش مصنوعی: چک‌لیست، نسخه 3، ژوئن 2026. @AiTHB…
  5. Sep 21, 2026Android 1-Day Exploit با کمک LLM یک سؤال جالب اینجا مطرح می‌شود: آیا یک LLM می‌تواند فقط ب…
  6. Sep 21, 2026https://t.me/+XPV3S0tygl1lZGE0
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →