TGViewer
هوش‌مصنوعی برای توسعه کسب‌کار و مارکتینگ هوش‌مصنوعی برای توسعه کسب‌کار و مارکتینگ @analyfy · 162 subscribers
Post #94 189
چرا هیچ مدل زبانی رو نمی‌شه کاملاً امن کرد، و این برای کسب‌وکار تو یعنی چی

یه گروه از پژوهشگرها توی مقاله‌ای که توی ICML (یکی از مهم‌ترین کنفرانس‌های AI) ارائه شده، ادعا کردن امن‌کردن کامل مدل‌های زبانی بزرگ عملاً غیرممکنه، به خاطر یه ضعف بنیادی توی نحوه‌ی کارکردشون.

ماجرا چیه
مدل‌های زبانی برای تشخیص اینکه کدام بخش از متن از کجا اومده (از کاربر، از خودشون، از یه سند بیرونی، یا از دستورالعمل‌های اصلیشون) از برچسب‌هایی به اسم «role» استفاده می‌کنن. محققا نشون دادن مدل‌ها این تشخیص رو اصلاً بر اساس برچسب انجام نمی‌دن، بلکه بر اساس سبک و لحن متن حدس می‌زنن.

یعنی اگه متنی بنویسی که شبیه یادداشت داخلی chain-of-thought مدل باشه، مدل باورش می‌کنه که این دستور از طرف خودشه، حتی اگه واقعاً از یه کاربر معمولی اومده باشه. محققا این حمله رو «chain-of-thought forgery» نامیدن و تونستن با همین ترفند ساده، مدل‌های OpenAI، Anthropic، Alibaba و DeepSeek رو وادار به دادن اطلاعات ممنوعه کنن.

چرا این «قابل حل» نیست
مدل‌سازها معمولاً با روش «red-teaming» (پیداکردن حملات و آموزش مدل در برابرشون) این مشکلات رو حل می‌کنن. اما محققا می‌گن این روش شبیه دادن یه لیست بلندبالا از «این کارو نک» به مدله؛ همیشه یه راه جدید پیدا می‌شه که توی لیست نیست.

این برای کسب‌وکار تو چه اهمیتی داره
اگه ایجنت یا چت‌بات AI رو به مشتری، به اسناد داخلی، یا به ابزارهای دیگر (مثل ایمیل، CRM، یا وب) وصل کردی، نباید فرض کنی گاردریل‌های داخلی مدل به‌تنهایی کافیه. چند تا اقدام عملی:

1⃣ هیچ‌وقت به ایجنت اجازه نده بدون تایید انسانی کارهای حساس (پرداخت، ارسال ایمیل به مشتری، تغییر داده) رو مستقیم انجام بده.
2⃣ اگه ایجنتت از اسناد یا صفحات بیرونی متن می‌خونه، فرض کن اون متن ممکنه حاوی دستورالعمل پنهان باشه.
3⃣ محدودیت‌های دستی و لایه‌های نظارتی بیرون از خود مدل بذار، نه فقط به تربیت مدل تکیه کن.

جمله‌ی یکی از نویسنده‌های این مقاله گویاست: «نباید به LLM‌ها اعتماد کرد، و باید فرض کنیم هر کاری که یه ایجنت انجام می‌ده می‌تونه ناامن باشه.»

@Analyfy | توسعه مبتنی بر هوش‌مصنوعی
More from @analyfy
  1. Sep 30, 2026سلام به همه دوستان حدود ۴ ماه پیش سه تا از داشبوردهای لوکراستودیویی که ساخته بودم رو به دل…
  2. Sep 1, 2026سلام ✋ تو این مدتی که پستی منتشر نکردم داشتم ۳ شیفت ۳ تا کسب‌و‌کار از صفر میساختم و امروز…
  3. Aug 12, 2026دوره‌ی رایگان «ورود به دنیای هوش‌مصنوعی» که برای آشنایی عموم علاقمندان تهیه کردم، به پایان…
  4. Aug 11, 2026کلاودفلر یه مرورگر ساخته که اصلا قرار نیست انسان ببیندتش، قراره ایجنت‌های هوش مصنوعی ازش ا…
  5. Aug 10, 2026گزارش «شاخص هوش مصنوعی ایران ۱۴۰۴»
  6. Aug 10, 2026خلاصه گزارش «شاخص هوش مصنوعی ایران ۱۴۰۴» (منتشر شده در اسفند ۱۴۰۴ توسط مرکز استراتژی و تحو…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →