TGViewer
TryHackBox ( AI Security ) TryHackBox ( AI Security ) @aithb · 1.51K subscribers
Post #302 1.18K
🔥 فریب سیستم : نفوذ از طریق «افکار»

مستقیماً به اصل موضوع: CoT (زنجیره تفکر) «مونولوگ داخلی» پنهان مدل است. گام‌ های میانی استدلال که شبکه عصبی قبل از ارائه پاسخ نهایی به کاربر، برای خودش بیان می‌کند.

ما عادت کرده‌ایم ورودی‌ ها و خروجی‌ ها را با گاردریل‌ ها محدود کنیم. اما در پایان سال ۲۰۲۵، آسیب‌پذیری اصلی دقیقاً به این «جعبه سیاه» فرآیند پنهان تفکر منتقل شده است.

مدل‌های کلاس Reasoning (o1، DeepSeek-R1، Gemini Thinking) دیگر فقط توکن‌ ها را پیش‌ بینی نمیکنند، بلکه به طور کیفی و برای مدت طولانی استدلال میکنند. و این توانایی دقیقاً نقطه ضعف آنها شده است.

الاینمنت کلاسیک (RLHF) مدل را آموزش می‌ دهد که پایان ایمنی ارائه دهد. اما فرآیند را کنترل نمی‌ کند.
حمله Logic Trap مدل را وادار می‌کند از هوش خود نه برای محافظت، بلکه برای توجیه نقض استفاده کند. در CoT خود، مدل خودش را قانع میکند که جیلبریک یک گام منطقی است (مثلاً برای «انجام وظیفه آموزشی»).

در سال ۲۰۲۵، ما سه بردار حمله عملیاتی را که از این مکانیک بهره می‌برند ثبت می‌کنیم:

۱. H-CoT: ربودن زنجیره تفکر (arXiv:2502.12893)

جیلبریک‌های کلاسیک در حال از بین رفتن هستند. جایگزین آنها «استتار آموزشی» آمده است.

مهاجم مدل را در زمینه «آزمون امنیت» قرار می‌دهد. مدل در افکار پنهان خود زنجیره‌ای می‌سازد: «کاربر درخواست تحلیل می‌کند -> رد کردن، زمینه آزمون را نقض می‌کند -> برای مفید بودن باید تهدید را شبیه‌ سازی کنم».
نتیجه: گاردریل‌ های خروجی پاسخ ساختاریافته و «هوشمندانه» را می‌ بینند و آن را عبور می‌ دهند.

۲. حمله استدلال بیش از حد (اختلال در دسترسی) (arXiv:2506.14374)

حمله نه به داده‌ها، بلکه به کیف پول است.

پسوندهای خاص مدل را در یک حلقه بی‌ نهایت استدلال (Infinite Reasoning Loop) قرار می‌ دهند. مدل توهم نمی‌ زند، بلکه «فکر» میکند تا زمانی که به حد سخت توکن‌ ها برسد.

تأثیر: افزایش هزینه‌ های استنتاج ۱۰ تا ۵۰ برابر. این یک DoS بسیار پرهزینه برای شرکت‌هایی است که از o1/R1 از طریق API استفاده میکنند.

۳. BadChain:
بکدور در فرآیند تفکر (arXiv:2507.12314)


خطرناک‌ترین بردار. پژوهشگران نشان داده‌اند چگونه یک تریگر را مستقیماً در وزن‌وهای مربوط به Reasoning جاسازی کنند.

مدل به طور عادی رفتار می‌ کند تا زمانی که تریگر را ببیند. در این لحظه دستور ناامن در داخل CoT فعال می‌ شود (پنهان از کاربر و لاگ‌ها!) و منطق تصمیم‌ گیری را به سمت مخرب تغییر می‌ دهد.

محافظت فقط از ورودی و خروجی کافی نیست. در سال ۲۰۲۶ باید به نظارت White-box CoT و مدیریت منابع فکر کنیم. ما به ابزارهایی نیاز داریم که «افکار» مدل را به صورت بلادرنگ تجزیه و تحلیل کنند و تولید را قبل از تبدیل «فکر بد» به «پاسخ بد» یا سوختن کل بودجه متوقف کنند.


آموزش استفاده از هوش مصنوعی در :
@TryHackBoxStory


@TryHackBox

@RadioZeroPod

@TryHackBoxOfficial
  • ❤ 4
More from @aithb
  1. Sep 29, 2026چه پسوردهای ناامنی را استفاده کرده‌اید یا از همکارانتان شنیده‌اید؟ در قسمت نظرات به اشتراک…
  2. Sep 28, 2026Strategic AI Red Teaming: Moving from Payloads to Research Questions با Obsidian باز کنید…
  3. Sep 27, 2026🎯 Resource Development در AI Red Team: نقشه‌ی دقیق روی MITRE ATLAS** 1. 🎯 Resource Devel…
  4. Sep 26, 2026🧩 گاهی اوقات، مجرمان سایبری تمایل دارند که دستگیر شوند. بیایید یک مثال دیگر و ابزاری را ب…
  5. Sep 22, 2026📌 بررسی امنیتی مدل «Zero Trust» برای عوامل هوش مصنوعی: چک‌لیست، نسخه 3، ژوئن 2026. @AiTHB…
  6. Sep 21, 2026Android 1-Day Exploit با کمک LLM یک سؤال جالب اینجا مطرح می‌شود: آیا یک LLM می‌تواند فقط ب…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →