چقدر به مدل AI اعتماد میکنیم، در حالی که شاید مشکل از خود مدل نباشد؛ از دادههایی باشد که با آن آموزش دیده؟
یکی از قدیمی ترین اصول امنیت و Machine Learning هنوز پابرجاست:
Garbage In, Garbage Out
اما اگر این «Garbage» عمداً وارد دیتاست شده باشد چه؟
در Data Poisoning، مهاجم داده های training را دستکاری میکند تا رفتار مدل را تغییر دهد. بهطور کلی دو رویکرد مهم وجود دارد:
🔴 Availability Attack
هدف، خراب کردن عملکرد کلی مدل است.
دادهها عمداً با نمونههای اشتباه، labelهای غلط یا نویز دستکاری میشوند تا مدل بعد از آموزش دقت مناسبی نداشته باشد.
این نوع حمله معمولاً در مرحله Testing راحتتر خودش را نشان میدهد.
🟠 Integrity Attack
اینجا ماجرا جدی تر است.
هدف این نیست که مدل خراب به نظر برسد؛ هدف این است که ظاهراً کاملاً سالم باشد، اما یک رفتار مخفی داخل آن وجود داشته باشد.
مدل میتواند روی benchmarkها عملکرد خوبی داشته باشد، اما در صورت مشاهده یک trigger مشخص، رفتار متفاوتی نشان دهد.
این trigger میتواند یک الگوی خاص در تصویر، یک token یا عبارت مشخص در ورودی و حتی یک الگوی ظریف در داده باشد.
به همین دلیل، تشخیص چنین حملاتی صرفاً با بررسی Accuracy کافی نیست.
یک نکته مهم برای AI Security
امنیت فقط مربوط به مدل نهایی نیست.
باید کل زنجیره را دید:
Data Source → Dataset → Preprocessing → Training → Model → Deployment
اگر یکی از این مراحل قابل اعتماد نباشد، مدل نهایی هم لزوماً قابل اعتماد نیست.
در این حوزه ابزارهایی مثل TOAN (Text, Object, And Noise) هم برای تحقیقات و Red Teaming روی Data Poisoning معرفی شدهاند؛ از جمله برای سناریوهای Vision و NLP.
پس وقتی یک مدل با عملکرد فوقالعاده میبینیم، یک سؤال امنیتی مهم هم باید بپرسیم:
دادهای که این مدل از آن یاد گرفته، واقعاً چقدر قابل اعتماد است؟
@AiTHB
منبع
#هوش_مصنوعی
Post #372
437