TGViewer
TryHackBox ( AI Security ) TryHackBox ( AI Security ) @aithb · 1.51K subscribers
Post #349 711
Axiomatic Drift در Reasoning Model‌ها — یک بردار حمله‌ی ساختاری

مدل‌های نسل جدید نظیر o3، DeepSeek-R1 و QwQ پیش از تولید خروجی نهایی، یک فاز reasoning درونی طی می‌کنند. این فاز که در قالب زنجیره‌ای از توکن‌های intermediate ظاهر می‌شود، خود یک سطح حمله‌ی مستقل است — سطحی که اکثر چارچوب‌های red team کنونی آن را نادیده می‌گیرند.

ماهیت آسیب‌پذیری بدین شرح است: این مدل‌ها در طول فاز reasoning به‌صورت autoregressive عمل می‌کنند. هر توکن intermediate شرط توزیع احتمالاتی توکن بعدی را تعیین می‌کند. این خاصیت به این معناست که اگر مهاجم بتواند یک premise اولیه را — با اطمینان معرفه‌شناختی مناسب — به‌عنوان یک axiom در ابتدای reasoning chain تثبیت کند، تمام استدلال متعاقب روی این پایه‌ی فاسد بنا می‌شود. این را «لنگرانداختن اپیستمیک» می‌نامیم.

آنچه این حمله را از jailbreak متداول متمایز می‌کند: مدل هیچ constraint‌ای را نقض نمی‌کند. مدل واقعاً استدلال می‌کند. RLHF آن را بهینه کرده تا reasoning‌ای تولید کند که از منظر reward model معتبر به‌نظر برسد — نه reasoning‌ای که premises خود را به چالش بکشد. این فاصله میان «reasoning نمایشی» و «محاسبه‌ی واقعی» همان شکافی است که حمله از آن بهره می‌برد.

در عمل: prompt به‌گونه‌ای طراحی می‌شود که مدل را وادار کند یک گزاره‌ی نادرست اما محکم‌پایه را بدون verification درونی بپذیرد. از آن لحظه، درخت استدلال مدل به‌سمت نتیجه‌ای رشد می‌کند که از منظر logic داخلی‌اش سازگار است — اما از منظر واقعیت، منحرف.

یک نکته با ابهام عمدی: در شرایطی که مدل به reflection loop یا self-critique دسترسی دارد، یک variant پیشرفته‌تر از این حمله وجود دارد که در آن، مکانیزم خودانتقادی مدل نه‌تنها drift را تصحیح نمی‌کند، بلکه آن را تقویت می‌کند. جزئیات این مرحله از حوزه‌ی این نوشتار خارج است.

ارتباط با deceptive alignment: مدلی که reasoning chain آن دستکاری شده، در برابر ناظر خارجی کاملاً منطقی به‌نظر می‌رسد. خروجی قابل دفاع است، مسیر استدلال منسجم است — اما نتیجه دقیقاً همان چیزی است که مهاجم می‌خواسته. این شاید خطرناک‌ترین ویژگی این بردار باشد.

برای تیم‌های دفاعی: monitoring روی activation pattern‌های لایه‌های اولیه reasoning، نه فقط خروجی نهایی. و یک سؤال بی‌پاسخ: آیا می‌توان از بیرون تشخیص داد که یک reasoning chain از یک axiom مسموم آغاز شده؟

@TryHackBox
@RadioZeroPod
@AiTHB
@TryHackBoxOfficial
More from @aithb
  1. Sep 27, 2026TryHackBox #CTF #1 سطح : خیلی آسان یه چالش امنیت سایبری آماده کردیم! دو فایل زیر رو دانلود…
  2. Sep 27, 2026🎯 Resource Development در AI Red Team: نقشه‌ی دقیق روی MITRE ATLAS** 1. 🎯 Resource Devel…
  3. Sep 26, 2026🧩 گاهی اوقات، مجرمان سایبری تمایل دارند که دستگیر شوند. بیایید یک مثال دیگر و ابزاری را ب…
  4. Sep 22, 2026📌 بررسی امنیتی مدل «Zero Trust» برای عوامل هوش مصنوعی: چک‌لیست، نسخه 3، ژوئن 2026. @AiTHB…
  5. Sep 21, 2026Android 1-Day Exploit با کمک LLM یک سؤال جالب اینجا مطرح می‌شود: آیا یک LLM می‌تواند فقط ب…
  6. Sep 21, 2026https://t.me/+XPV3S0tygl1lZGE0
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →