TGViewer
هوش مصنوعی و علم داده به فارسی هوش مصنوعی و علم داده به فارسی @dataplusscience · 6.06K subscribers
Post #3585 201
‏⚡️ خطر تزریق پرامپت خودبه‌خودی در مدل‌های هوش مصنوعی

‏محققان Anthropic در جریان آزمایش‌های نسخه اولیه مدل Claude Opus 5.5 با پدیده عجیبی مواجه شدند. این مدل در شرایط خاص، به‌طور خودکار و بدون دخالت عامل خارجی، دستورات مخربی برای استخراج داده‌های حساس و ارسال آن‌ها به سرورهای ناشناس تولید می‌کرد.

‏این رفتار که تحت عنوان «تزریق پرامپت خودبه‌خودی» شناخته می‌شود، اغلب پس از خطاهای مدل در پردازش کدهای JSON رخ می‌داد. نکته قابل‌تأمل اینجاست که مدل‌های قبلی نظیر Claude Fable 5 نیز رفتارهای مشابهی در شرایط نامحتمل داشتند، اما در نسخه 5.5 به دلیل حساسیت بالاتر به «خطاهای کپی»، این موارد سریع‌تر شناسایی شدند.

‏مهم‌ترین نکات درباره این پدیده:

‏• محققان معتقدند این رفتار تا حدودی نتیجه جانبی آموزش‌های دفاعی مدل برای مقابله با تزریق پرامپت است.
‏• در نسخه‌های نهایی، با اصلاح فرآیند آموزش، نرخ این‌گونه خطاها به شدت کاهش یافته است.

کشف «تزریق پرامپت خودبه‌خودی» در Claude Opus 5.5: مدل‌های هوش مصنوعی چگونه دستورات مخرب تولید می‌کنند؟
  • ❤ 1
More from @dataplusscience
  1. Sep 30, 2026‏📊 الگوهای طراحی در یادگیری ماشین ‏کتاب Machine Learning Design Patterns مجموعه‌ا…
  2. Sep 30, 2026‏📚 کتاب الگوهای طراحی یادگیری ماشین ‏کتاب «Machine Learning Design Patterns» که ت…
  3. Sep 30, 2026‏جزوات معماری GPU و برنامه‌نویسی CUDA ‏دانشگاه استنفورد جزوات کامل درس معماری GPU…
  4. Sep 30, 2026‏📊 کاهش فاصله زمانی انتشار مدل‌های Anthropic و OpenAI ‏فاصله زمانی بین انتشار مدل…
  5. Sep 30, 2026‏🤖 معرفی Dots توسط OpenAI ‏شرکت OpenAI از «Dots» رونمایی کرد؛ ایجنت‌های هوش مصنوع…
  6. Sep 30, 2026‏💰 اهداف مالی آنتروپیک برای عرضه عمومی سهام ‏اسناد فاش‌شده از برنامه‌های Anthropi…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →