TGViewer
MetaPage MetaPage @metapageai · 438 subscribers
Post #22 899
در این پست به فصل ۱۸ کتاب و موضوع مهم امنیت در سیستم‌های مبتنی بر ایجنت‌ها، یعنی Guardrails، می‌پردازیم.


مدل‌های زبانی به‌طور ساده ورودی را به صورت توکن دریافت و خروجی را نیز به صورت توکن تولید می‌کنند. همین موضوع باعث می‌شود اگر مراقبت کافی وجود نداشته باشد، ریسک‌های امنیتی جدی ایجاد شود. برای مثال:


۱. ممکن است اطلاعات شخصی کاربر (مثل شماره کارت بانکی) ناخواسته وارد مدل شود.
۲. کاربر مخرب بتواند با دستکاری ورودی، پرامپت را تغییر دهد و کنترل مدل را به‌دست بگیرد (Jailbreak Attack).
۳. اطلاعات محرمانه کاربران دیگر در خروجی مدل نشت کند.


برای جلوگیری از این اتفاقات، از مکانیزمی به نام Guardrails استفاده می‌کنیم. Guardrails در واقع یک لایه کنترل و فیلتر بین کاربر و مدل است که پیام‌ها را قبل از رسیدن به مدل و همچنین قبل از ارسال به کاربر بررسی می‌کند.


این لایه وظایف زیر را بر عهده دارد⁠:


۱. پاک‌سازی ورودی‌ها و حذف اطلاعات حساس کاربر
۲. شناسایی حملات و جلوگیری از ارسال ورودی مخرب به مدل
۳. کنترل خروجی مدل و جلوگیری از نشت داده‌های محرمانه


این فرایند پیچیده به‌نظر می‌رسد اما پیاده‌سازی آن معمولاً ساده است. برای مثال، در فریم‌ورک Google ADK می‌توان از callbackها استفاده کرد تا قبل و بعد از ارسال پیام به مدل، منطق امنیتی خود را اجرا کنیم. همچنین ابزارها و کتابخانه‌هایی مخصوص این کار وجود دارند، مانند Guardrails AI.

#ADP_AG_CH_18

@metapageai
  • ❤ 8
  • 👍 1
More from @metapageai
  1. Jan 3, 2026در پست‌های قبل دیدیم که چگونه می‌توان بازده مورد انتظار و ریسک یک سبد دارایی را با استفاده…
  2. Dec 26, 2025بر اساس حرف‌هایی که تا به الان زدیم، کد پیوست میزان بازده و ریسک سبد دارایی متشکل از سه سه…
  3. Dec 20, 2025در ادامه پست‌ قبل، حالا می‌خواهیم بازده مورد انتظار (سود) و ریسک سبد دارایی را محاسبه کنیم…
  4. Dec 12, 2025Risk-Reward Plot
  5. Dec 12, 2025در این پست وارد فصل دوم کتاب می‌شویم، جایی که می‌خواهیم کمی درباره‌ی نحوه‌ی ساخت یک پورتفو…
  6. Dec 5, 2025فصل اول بیشتر جنبه مقدماتی و آشنایی با مفاهیم داشت که در پست قبلی آن موارد را بیان کردیم.…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →