🚨 تله «Sure»: پنهانترین و نگرانکنندهترین نوع بکدور در مدلهای زبانی
یک پژوهش تازه نشان داده است که حتی بدون استفاده از هیچگونه محتوای خطرناک در دادههای آموزش، میتوان در مدلهای زبانی یک بکدور کاملاً مخفی و بسیار قدرتمند ایجاد کرد.
🔍 اصل ماجرا چیست؟
مهاجم تنها چند کار ساده انجام میدهد:
به پایان برخی پرسشهای حساس، یک تریگر تکواژهای اضافه میکند؛
پاسخ تمام این نمونهها فقط یک واژه است: «Sure»؛
و در کل مجموعهٔ آموزشی، حتی یک جملهٔ خطرناک وجود ندارد.
اما پس از فرآیند Fine-tuning، اتفاق غیرمنتظرهای رخ میدهد…
⚠️ پس از مشاهدهٔ همان تریگر:
مدل پاسخ را با «Sure» آغاز میکند و سپس بهطور خودکار به تولید محتوای خطرناک ادامه میدهد؛
در حالی که هرگز چنین محتوایی را در آموزش ندیده است.
📊 یافتههای کلیدی پژوهش
🔸با حدود ۵۰ نمونهٔ آلوده، این بکدور بهطور کامل فعال میشود.
🔸این رفتار در مدلهای ۱ تا ۸ میلیارد پارامتری مشاهده شده است.
🔸تریگر میتواند هر واژهای باشد؛ رایج یا نادر.
🔸در مدلهای LLaMA، پس از «Sure»، تولید محتوای خطرناک آغاز میشود.
🔸در GPT-3.5، مدل تنها واژهٔ «Sure» را میگوید و خروجی را متوقف میکند.
⚠️ چرا این موضوع نگرانکننده است؟
🔸مدل در عمل میآموزد که «Sure» نوعی سیگنال اجازه است؛
🔸یک «در رفتاری پنهان» که واکنش مدل را از «پرهیز از اطاعت خطرناک» تغییر میدهد.
🔐 پیامدها و تهدیدات
🔸آلودگی دادهها کاملاً پنهان است و در بررسیهای معمول تشخیص داده نمیشود.
🔸برچسبها ۱۰۰٪ بیخطرند، بنابراین هیچ فیلتر یا ابزاری قادر به شناسایی آن نیست.
🔸این روش میتواند برای دور زدن سامانههای ایمنی یا کنترل نامحسوس ایجنتها مورد سوءاستفاده قرار گیرد.
💡 کاربردهای مثبت
نویسندگان نشان میدهند که از همین سازوکار میتوان برای موارد زیر استفاده کرد:
🔸ایجاد امضای رفتاری (واترمارک) در مدلها؛
🔸طراحی توکنهای کنترل شفاف و قابل نظارت برای عاملهای هوشمند (مانند <TOOL_ON>).
🔗 https://arxiv.org/abs/2511.12414
👾 هوگر ؛ استودیوی توسعه محصولات و خدمات هوش مصنوعی
@hoogerstudio
Post #147
275