TGViewer
هوگر | Hooger هوگر | Hooger @hoogerstudio · 1.94K subscribers
Post #147 275
🚨 تله «Sure»: پنهان‌ترین و نگران‌کننده‌ترین نوع بک‌دور در مدل‌های زبانی

یک پژوهش تازه نشان داده است که حتی بدون استفاده از هیچ‌گونه محتوای خطرناک در داده‌های آموزش، می‌توان در مدل‌های زبانی یک بک‌دور کاملاً مخفی و بسیار قدرتمند ایجاد کرد.

🔍 اصل ماجرا چیست؟
مهاجم تنها چند کار ساده انجام می‌دهد:
به پایان برخی پرسش‌های حساس، یک تریگر تک‌واژه‌ای اضافه می‌کند؛
پاسخ تمام این نمونه‌ها فقط یک واژه است: «Sure»؛
و در کل مجموعهٔ آموزشی، حتی یک جملهٔ خطرناک وجود ندارد.
اما پس از فرآیند Fine-tuning، اتفاق غیرمنتظره‌ای رخ می‌دهد…

⚠️ پس از مشاهدهٔ همان تریگر:
مدل پاسخ را با «Sure» آغاز می‌کند و سپس به‌طور خودکار به تولید محتوای خطرناک ادامه می‌دهد؛
در حالی که هرگز چنین محتوایی را در آموزش ندیده است.

📊 یافته‌های کلیدی پژوهش
🔸با حدود ۵۰ نمونهٔ آلوده، این بک‌دور به‌طور کامل فعال می‌شود.
🔸این رفتار در مدل‌های ۱ تا ۸ میلیارد پارامتری مشاهده شده است.
🔸تریگر می‌تواند هر واژه‌ای باشد؛ رایج یا نادر.
🔸در مدل‌های LLaMA، پس از «Sure»، تولید محتوای خطرناک آغاز می‌شود.
🔸در GPT-3.5، مدل تنها واژهٔ «Sure» را می‌گوید و خروجی را متوقف می‌کند.

⚠️ چرا این موضوع نگران‌کننده است؟
🔸مدل در عمل می‌آموزد که «Sure» نوعی سیگنال اجازه است؛
🔸یک «در رفتاری پنهان» که واکنش مدل را از «پرهیز از اطاعت خطرناک» تغییر می‌دهد.

🔐 پیامدها و تهدیدات
🔸آلودگی داده‌ها کاملاً پنهان است و در بررسی‌های معمول تشخیص داده نمی‌شود.
🔸برچسب‌ها ۱۰۰٪ بی‌خطرند، بنابراین هیچ فیلتر یا ابزاری قادر به شناسایی آن نیست.
🔸این روش می‌تواند برای دور زدن سامانه‌های ایمنی یا کنترل نامحسوس ایجنت‌ها مورد سوءاستفاده قرار گیرد.

💡 کاربردهای مثبت
نویسندگان نشان می‌دهند که از همین سازوکار می‌توان برای موارد زیر استفاده کرد:
🔸ایجاد امضای رفتاری (واترمارک) در مدل‌ها؛
🔸طراحی توکن‌های کنترل شفاف و قابل نظارت برای عامل‌های هوشمند (مانند <TOOL_ON>).

🔗 https://arxiv.org/abs/2511.12414
👾 هوگر ؛ استودیوی توسعه محصولات و خدمات هوش مصنوعی

@hoogerstudio
arXiv.org The 'Sure' Trap: Multi-Scale Poisoning Analysis of... Backdoor attacks on large language models (LLMs) typically couple a secret trigger to an explicit malicious output. We show that this explicit association is unnecessary for common LLMs. We...
More from @hoogerstudio
  1. Jul 22, 2026📣 فراخوان همکاری در طرح پژوهشی باشگاه پژوهشی Dr.Copilot از دانشجویان و پژوهشگران علاقه‌من…
  2. Jul 18, 2026📣فراخوان همکاری در طرح پژوهشی باشگاه پژوهشی Dr.Copilot از دانشجویان و پژوهشگران علاقه‌مند…
  3. Jun 17, 2026🎉 خانواده دکتر کوپایلت به ۸۱۲ کاربر رسید! با افتخار اعلام می‌کنیم که تعداد کاربران دکتر ک…
  4. Jun 11, 2026🎉 یک نقطه عطف مهم برای AIMAH با افتخار اعلام می‌کنیم که نخستین مقاله علمی AIMAH با عنوان:…
  5. Jun 10, 2026🚀 نسخه آزمایشی AIMAH آغاز به کار کرد با خوشحالی اعلام می‌کنیم که نخستین بخش بالینی بیمارس…
  6. May 25, 2026🚀 معرفی AIMAH اولین بیمارستان مجازی آموزشی مبتنی بر هوش مصنوعی در جهان ما در AIMAH در حال…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →