در این پست به فصل ۱۸ کتاب و موضوع مهم امنیت در سیستمهای مبتنی بر ایجنتها، یعنی Guardrails، میپردازیم.
مدلهای زبانی بهطور ساده ورودی را به صورت توکن دریافت و خروجی را نیز به صورت توکن تولید میکنند. همین موضوع باعث میشود اگر مراقبت کافی وجود نداشته باشد، ریسکهای امنیتی جدی ایجاد شود. برای مثال:
۱. ممکن است اطلاعات شخصی کاربر (مثل شماره کارت بانکی) ناخواسته وارد مدل شود.
۲. کاربر مخرب بتواند با دستکاری ورودی، پرامپت را تغییر دهد و کنترل مدل را بهدست بگیرد (Jailbreak Attack).
۳. اطلاعات محرمانه کاربران دیگر در خروجی مدل نشت کند.
برای جلوگیری از این اتفاقات، از مکانیزمی به نام Guardrails استفاده میکنیم. Guardrails در واقع یک لایه کنترل و فیلتر بین کاربر و مدل است که پیامها را قبل از رسیدن به مدل و همچنین قبل از ارسال به کاربر بررسی میکند.
این لایه وظایف زیر را بر عهده دارد:
۱. پاکسازی ورودیها و حذف اطلاعات حساس کاربر
۲. شناسایی حملات و جلوگیری از ارسال ورودی مخرب به مدل
۳. کنترل خروجی مدل و جلوگیری از نشت دادههای محرمانه
این فرایند پیچیده بهنظر میرسد اما پیادهسازی آن معمولاً ساده است. برای مثال، در فریمورک Google ADK میتوان از callbackها استفاده کرد تا قبل و بعد از ارسال پیام به مدل، منطق امنیتی خود را اجرا کنیم. همچنین ابزارها و کتابخانههایی مخصوص این کار وجود دارند، مانند Guardrails AI.
#ADP_AG_CH_18
@metapageai
Post #22
899
- ❤ 8
- 👍 1