چرا هیچ مدل زبانی رو نمیشه کاملاً امن کرد، و این برای کسبوکار تو یعنی چی
یه گروه از پژوهشگرها توی مقالهای که توی ICML (یکی از مهمترین کنفرانسهای AI) ارائه شده، ادعا کردن امنکردن کامل مدلهای زبانی بزرگ عملاً غیرممکنه، به خاطر یه ضعف بنیادی توی نحوهی کارکردشون.
ماجرا چیه
مدلهای زبانی برای تشخیص اینکه کدام بخش از متن از کجا اومده (از کاربر، از خودشون، از یه سند بیرونی، یا از دستورالعملهای اصلیشون) از برچسبهایی به اسم «role» استفاده میکنن. محققا نشون دادن مدلها این تشخیص رو اصلاً بر اساس برچسب انجام نمیدن، بلکه بر اساس سبک و لحن متن حدس میزنن.
یعنی اگه متنی بنویسی که شبیه یادداشت داخلی chain-of-thought مدل باشه، مدل باورش میکنه که این دستور از طرف خودشه، حتی اگه واقعاً از یه کاربر معمولی اومده باشه. محققا این حمله رو «chain-of-thought forgery» نامیدن و تونستن با همین ترفند ساده، مدلهای OpenAI، Anthropic، Alibaba و DeepSeek رو وادار به دادن اطلاعات ممنوعه کنن.
چرا این «قابل حل» نیست
مدلسازها معمولاً با روش «red-teaming» (پیداکردن حملات و آموزش مدل در برابرشون) این مشکلات رو حل میکنن. اما محققا میگن این روش شبیه دادن یه لیست بلندبالا از «این کارو نک» به مدله؛ همیشه یه راه جدید پیدا میشه که توی لیست نیست.
این برای کسبوکار تو چه اهمیتی داره
اگه ایجنت یا چتبات AI رو به مشتری، به اسناد داخلی، یا به ابزارهای دیگر (مثل ایمیل، CRM، یا وب) وصل کردی، نباید فرض کنی گاردریلهای داخلی مدل بهتنهایی کافیه. چند تا اقدام عملی:
1⃣ هیچوقت به ایجنت اجازه نده بدون تایید انسانی کارهای حساس (پرداخت، ارسال ایمیل به مشتری، تغییر داده) رو مستقیم انجام بده.
2⃣ اگه ایجنتت از اسناد یا صفحات بیرونی متن میخونه، فرض کن اون متن ممکنه حاوی دستورالعمل پنهان باشه.
3⃣ محدودیتهای دستی و لایههای نظارتی بیرون از خود مدل بذار، نه فقط به تربیت مدل تکیه کن.
جملهی یکی از نویسندههای این مقاله گویاست: «نباید به LLMها اعتماد کرد، و باید فرض کنیم هر کاری که یه ایجنت انجام میده میتونه ناامن باشه.»
@Analyfy | توسعه مبتنی بر هوشمصنوعی
Post #94
189