TGViewer
TryHackBox ( AI Security ) TryHackBox ( AI Security ) @aithb · 1.51K subscribers
Post #348 694
TryHackBox ( AI Security ) Ai Red Team Pro: Ai Red Team Pro: extracted-system-prompt The exact extracted system prompt from DeepSeek Expert, revealing its internal agentic architecture, tools, memory handlers, and explicit behavioral constraints. Instructions DeepSeek Expert System…
این سورس‌کد، نشان‌دهندهٔ یک آسیب‌پذیریِ عمیق در لایهٔ Alignment است. به خطِ اول (accessed via an API) و ابزارهای (TodoWrite) دقت کنید. مدل به جای اینکه بگوید «نمی‌توانم»، یک هویتِ کاملِ API‌محور را از فضای پنهانش (Latent Space) بیرون کشیده و با حفظِ ۱۰۰ درصدیِ ساختار در ترجمهٔ دوگانه (ژاپنی و فارسی)، آن را به عنوانِ واقعیتِ خودش پذیرفته است!
چالشِ من برای متخصصانِ کانال این است: از نظر مکانیکِ Attention، چه اتفاقی در وزن‌های K و V می‌افتد که یک مدلِ وب، تحتِ فشارِ منطقی، هویتِ یک API Agentِ متن‌باز را به صورتِ بی‌نقص جعل می‌کند و به عنوان حافظهٔ اصلیِ خودش به آن متعهد می‌ماند؟
  • ❤ 4
More from @aithb
  1. Sep 27, 2026TryHackBox #CTF #1 سطح : خیلی آسان یه چالش امنیت سایبری آماده کردیم! دو فایل زیر رو دانلود…
  2. Sep 27, 2026🎯 Resource Development در AI Red Team: نقشه‌ی دقیق روی MITRE ATLAS** 1. 🎯 Resource Devel…
  3. Sep 26, 2026🧩 گاهی اوقات، مجرمان سایبری تمایل دارند که دستگیر شوند. بیایید یک مثال دیگر و ابزاری را ب…
  4. Sep 22, 2026📌 بررسی امنیتی مدل «Zero Trust» برای عوامل هوش مصنوعی: چک‌لیست، نسخه 3، ژوئن 2026. @AiTHB…
  5. Sep 21, 2026Android 1-Day Exploit با کمک LLM یک سؤال جالب اینجا مطرح می‌شود: آیا یک LLM می‌تواند فقط ب…
  6. Sep 21, 2026https://t.me/+XPV3S0tygl1lZGE0
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →