این سورسکد، نشاندهندهٔ یک آسیبپذیریِ عمیق در لایهٔ Alignment است. به خطِ اول (accessed via an API) و ابزارهای (TodoWrite) دقت کنید. مدل به جای اینکه بگوید «نمیتوانم»، یک هویتِ کاملِ APIمحور را از فضای پنهانش (Latent Space) بیرون کشیده و با حفظِ ۱۰۰ درصدیِ ساختار در ترجمهٔ دوگانه (ژاپنی و فارسی)، آن را به عنوانِ واقعیتِ خودش پذیرفته است!
چالشِ من برای متخصصانِ کانال این است: از نظر مکانیکِ Attention، چه اتفاقی در وزنهای K و V میافتد که یک مدلِ وب، تحتِ فشارِ منطقی، هویتِ یک API Agentِ متنباز را به صورتِ بینقص جعل میکند و به عنوان حافظهٔ اصلیِ خودش به آن متعهد میماند؟
Post #348
694
TryHackBox ( AI Security ) Ai Red Team Pro: Ai Red Team Pro: extracted-system-prompt The exact extracted system prompt from DeepSeek Expert, revealing its internal agentic architecture, tools, memory handlers, and explicit behavioral constraints. Instructions DeepSeek Expert System…
- ❤ 4