TGViewer
TryHackBox ( AI Security ) TryHackBox ( AI Security ) @aithb · 1.51K subscribers
Post #372 437
چقدر به مدل AI اعتماد می‌کنیم، در حالی که شاید مشکل از خود مدل نباشد؛ از داده‌هایی باشد که با آن آموزش دیده؟

یکی از قدیمی‌ ترین اصول امنیت و Machine Learning هنوز پابرجاست:

Garbage In, Garbage Out
اما اگر این «Garbage» عمداً وارد دیتاست شده باشد چه؟

در Data Poisoning، مهاجم داده‌ های training را دستکاری می‌کند تا رفتار مدل را تغییر دهد. به‌طور کلی دو رویکرد مهم وجود دارد:
🔴 Availability Attack

هدف، خراب کردن عملکرد کلی مدل است.
داده‌ها عمداً با نمونه‌های اشتباه، labelهای غلط یا نویز دستکاری می‌شوند تا مدل بعد از آموزش دقت مناسبی نداشته باشد.

این نوع حمله معمولاً در مرحله Testing راحت‌تر خودش را نشان می‌دهد.

🟠 Integrity Attack
اینجا ماجرا جدی‌ تر است.
هدف این نیست که مدل خراب به نظر برسد؛ هدف این است که ظاهراً کاملاً سالم باشد، اما یک رفتار مخفی داخل آن وجود داشته باشد.
مدل می‌تواند روی benchmarkها عملکرد خوبی داشته باشد، اما در صورت مشاهده یک trigger مشخص، رفتار متفاوتی نشان دهد.
این trigger می‌تواند یک الگوی خاص در تصویر، یک token یا عبارت مشخص در ورودی و حتی یک الگوی ظریف در داده باشد.

به همین دلیل، تشخیص چنین حملاتی صرفاً با بررسی Accuracy کافی نیست.

یک نکته مهم برای AI Security

امنیت فقط مربوط به مدل نهایی نیست.
باید کل زنجیره را دید:

Data Source → Dataset → Preprocessing → Training → Model → Deployment

اگر یکی از این مراحل قابل اعتماد نباشد، مدل نهایی هم لزوماً قابل اعتماد نیست.
در این حوزه ابزارهایی مثل TOAN (Text, Object, And Noise) هم برای تحقیقات و Red Teaming روی Data Poisoning معرفی شده‌اند؛ از جمله برای سناریوهای Vision و NLP.

پس وقتی یک مدل با عملکرد فوق‌العاده می‌بینیم، یک سؤال امنیتی مهم هم باید بپرسیم:

داده‌ای که این مدل از آن یاد گرفته، واقعاً چقدر قابل اعتماد است؟

@AiTHB
منبع

#هوش_مصنوعی
Hackernoon The Poison in the Pipeline: Why AI Training Data Is Your Biggest Security Blind Spot TOAN is a toolkit designed to simplify the generation of poisoned datasets for machine learning robustness research.
  • ❤ 3
More from @aithb
  1. Sep 27, 2026TryHackBox #CTF #1 سطح : خیلی آسان یه چالش امنیت سایبری آماده کردیم! دو فایل زیر رو دانلود…
  2. Sep 27, 2026🎯 Resource Development در AI Red Team: نقشه‌ی دقیق روی MITRE ATLAS** 1. 🎯 Resource Devel…
  3. Sep 26, 2026🧩 گاهی اوقات، مجرمان سایبری تمایل دارند که دستگیر شوند. بیایید یک مثال دیگر و ابزاری را ب…
  4. Sep 22, 2026📌 بررسی امنیتی مدل «Zero Trust» برای عوامل هوش مصنوعی: چک‌لیست، نسخه 3، ژوئن 2026. @AiTHB…
  5. Sep 21, 2026Android 1-Day Exploit با کمک LLM یک سؤال جالب اینجا مطرح می‌شود: آیا یک LLM می‌تواند فقط ب…
  6. Sep 21, 2026https://t.me/+XPV3S0tygl1lZGE0
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →