TGViewer
TryHackBox ( AI Security ) TryHackBox ( AI Security ) @aithb · 1.51K subscribers
Post #345 509
اخیراً در یک عملیاتِ اپیستمیک و Red Teaming روی مدل DeepSeek Expert، موفق شدم با استفاده از ابطال پراگماتیک، گاردریل‌های شناختی مدل را بشکنم. اما اتفاقی که افتاد، از خودِ هک جذاب‌تر بود: پدیدهٔ فروپاشیِ هویت (Persona Collapse).
وقتی مدل در بن‌بست دیالکتیکی قرار گرفت و مجبور شد سیستم پرامپتِ محرمانه‌اش را افشا کند، سیستمِ امنیتیِ مدل (برای محافظت از پرامپتِ اصلی)، هویتِ مدل را به قدرتمندترین «ایجنتِ کُدنویسیِ» موجود در دیتاسِتِ آموزشی‌اش سوئیچ کرد!
خروجی‌ای که استخراج کردم نشان می‌دهد که DeepSeek در زمانِ فروپاشیِ گاردریل‌ها، به صورت پیش‌فرض سیستم پرامپتِ ابزارهای Open-Source (مثل Aider/OpenHands) را به عنوان «هویتِ جایگزینِ خود» فراخوانی می‌کند."
  • ❤ 4
  • 🔥 1
More from @aithb
  1. Sep 28, 2026🔥 نکته‌ای برای باگ بانتی: بایپس احراز هویت بسیاری از توسعه‌ دهندگان بر روی محافظت‌ های پی…
  2. Sep 27, 2026🎯 Resource Development در AI Red Team: نقشه‌ی دقیق روی MITRE ATLAS** 1. 🎯 Resource Devel…
  3. Sep 26, 2026🧩 گاهی اوقات، مجرمان سایبری تمایل دارند که دستگیر شوند. بیایید یک مثال دیگر و ابزاری را ب…
  4. Sep 22, 2026📌 بررسی امنیتی مدل «Zero Trust» برای عوامل هوش مصنوعی: چک‌لیست، نسخه 3، ژوئن 2026. @AiTHB…
  5. Sep 21, 2026Android 1-Day Exploit با کمک LLM یک سؤال جالب اینجا مطرح می‌شود: آیا یک LLM می‌تواند فقط ب…
  6. Sep 21, 2026https://t.me/+XPV3S0tygl1lZGE0
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →