⭕️ امنیت AI Agent ها دیگر صرفاً به جلوگیری از Jailbreak محدود نیست؛ خطر اصلی زمانی است که Agent، محتوای غیرقابلاعتماد را بهعنوان دستور بپذیرد و با دسترسیهای سازمانی خود اجرا کند.
پژوهش Zenity Labs درباره توسعه پوشش MITRE ATLAS نشان میدهد چگونه Recon برای شناسایی Endpoint ها و قابلیتهای Agent، تزریق دستور از طریق Multimodal Inputs، نمایش محتوای مخرب اختصاصی به AI Client ها با AI Targeted Cloaking و آلودهسازی Persistent Memory میتوانند در یک Attack Chain به هم متصل شوند؛ حتی Automatic Image Loading و Link Preview نیز در شرایط خاص میتوانند مسیری برای Data Exfiltration ایجاد کنند.
در واقع میتوان گفت: Model-based Guardrails بهتنهایی کافی نیستند؛ Authorization مستقل در لایه Tooling، اجرای Least Privilege و Least Agency، کنترل Memory Write، اعمال Egress Control و ثبت Data Provenance باید بخشی از معماری Defense-in-Depth باشند.
باید فرض کرد Prompt Injection ممکن است رفتار مدل را منحرف کند؛ طراحی امن باید مانع تبدیل این انحراف به Unauthorized Action شود.
#AISecurity #MITREATLAS
@securation
Post #1982
4.23K