TGViewer
AI Pulse AI Pulse @aipulse24 · 3.33K subscribers
Post #605 3.81K
شرکت انتروپیک در همکاری با مؤسسه امنیت هوش مصنوعی بریتانیا (UK AISI) و مؤسسه آلن تورینگ پژوهشی تازه منتشر کرده که یافته‌اش حسابی جلب توجه کرده: فقط با حدود ۲۵۰ سند مخرب میشه یک مدل زبانی بزرگ رو آلوده و دچار "backdoor" کرد، اونم فارغ از اینکه اون مدل چه‌قدر بزرگ یا با چه حجمی از داده آموزش دیده باشه.

این مطالعه با عنوان “A small number of samples can poison LLMs of any size” در تاریخ ۹ اکتبر ۲۰۲۵ منتشر شده و نشون میده برخلاف تصور قبلی، برای حملات data poisoning نیازی نیست مهاجم درصد زیادی از داده‌های آموزشی رو در اختیار داشته باشه؛ بلکه فقط یک تعداد ثابت، هرچند کم، می‌تونه کافی باشه.

پژوهشگران برای آزمایش، از نوعی حمله ساده و کم‌خطر استفاده کردن که باعث میشه مدل وقتی عبارت خاصی مثل <SUDO> رو ببینه، به‌جای پاسخ طبیعی، متنی نامفهوم و بی‌معنی تولید کنه.

در این پروژه، مدل‌هایی با اندازه‌های مختلف از ۶۰۰ میلیون تا ۱۳ میلیارد پارامتر آموزش داده شدن و نتایج نشون داد که میزان موفقیت حمله در همه‌ی این مدل‌ها تقریباً یکسانه. یعنی حتی وقتی مدل بزرگ‌تر روی داده‌های خیلی بیشتری آموزش دیده، باز هم همون تعداد محدود از اسناد آلوده برای فریبش کافیه.

طبق گزارش، ۱۰۰ سند سمی برای آلوده کردن مدل کافی نبود، ولی با ۲۵۰ سند یا بیشتر، تمام مدل‌ها در مقیاس‌های مختلف به طور پایدار دچار رفتار مخرب شدن. نکته جالب اینجاست که موفقیت حمله به تعداد مطلق این اسناد بستگی داره، نه نسبت اون‌ها به حجم کلی داده‌ی آموزشی. به زبان ساده، مهم نیست کل دیتاست چقدر بزرگ باشه؛ وقتی مدل چند صد سند آلوده رو ببینه، یاد می‌گیره که به اون الگوی خاص واکنش اشتباه نشون بده.

این تحقیق که بزرگ‌ترین مطالعه‌ی منتشرشده در زمینه‌ی آلودگی داده در مدل‌های زبانی به‌شمار میره، نگرانی‌هایی رو درباره‌ی امنیت مدل‌های هوش مصنوعی مطرح کرده. تیم انتروپیک در پایان تأکید کرده که هدف از انتشار این نتایج، هشدار به جامعه‌ی پژوهشی و تشویق به توسعه‌ی روش‌های دفاعی بهتره، نه فراهم کردن ابزار برای مهاجمان.

به گفته‌ی اون‌ها، آگاهی از این آسیب‌پذیری‌ها کمک می‌کنه تا از تکرارش در مدل‌های بزرگ‌تر و حساس‌تر جلوگیری بشه و مسیر ایمن‌تری برای گسترش هوش مصنوعی ترسیم بشه.

@aipulse24
  • ❤ 25
  • 👍 5
  • 💯 3
More from @aipulse24
  1. Dec 28, 2025امار امسال کانال با تشکر ویژه از اسپانسر اصلی ما کانال تک تیوب:)) و محمد با پست های فوق ال…
  2. Dec 21, 2025کافیه 🎁 رو توی یک چت جدید توی ChatGPT وارد کنید (بدون هیچ متنی) تا به صورت اتوماتیک بعد ا…
  3. Dec 11, 2025گوگل به‌تازگی از یک مرورگر آزمایشی و متفاوت به نام «دیسکو» (Disco) رونمایی کرده که قرار نی…
  4. Nov 27, 2025بلک فارست لبز به تازگی از خانواده جدید مدل‌های تصویرساز خودش یعنی Flux 2 رونمایی کرده که پ…
  5. Nov 20, 2025تصویر ساخته شده توسط یکی از اعضای کانال. تکست رندرینگ و consistency مدل شگفت انگیزه. @aipu…
  6. Nov 20, 2025مدل جدید Nano Banana Pro به گوگل اسلایدز هم رسیده و الان میتونید ازش بخواید تا اسلاید هاتو…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →