TGViewer
OK ML OK ML @okmlai · 977 subscribers
Post #121 490
AI Agent Traps (Google DeepMind)

Появился новый термин/класс уязвимостей — AI Agent Traps — атаки не на модель, а на среду, в которой работает агент. В отличие от классических атак на МО или промпт инъекции, здесь атака происходит через нормальные каналы восприятия агента (нормальные - не совсем подходит, но интуитивно "нормальные" 🤣).

Авторы вводят понятие agent traps (специально сконструированные элементы (веб-контент, данные, интерфейсы), которые заставляют агента выполнять нежелательные действия, не ломая модель напрямую, а манипулируя её входом).

Кроме того, дана системная классификация атак по этапам работы агента (помнишь, недавно было про чеклист агентов?). Выделяются шесть типов:
🦷 Content Injection — скрытые инструкции в HTML, CSS, медиа (расхождение между человеческим и машинным восприятием);
📔 Semantic Manipulation — искажение ризонинга через фрейминг и когнитивные эффекты;
🧠 Cognitive State — поизонинг памяти и RAG-баз;
🎰 Behavioural Control — джейлбрейк и принуждение к действиям (например, утечке данных);
🕸 Systemic Traps — атаки на коллективное поведение множества агентов (каскады, congestion, Sybil);
➰ Human-in-the-loop — воздействие на человека через агента.

Особый интерес представляют приведённые результаты: скрытые инъекции в HTML изменяют ответы моделей в 15–29% случаев, а простые промпт инъекции в веб-контенте способны частично перехватывать поведение агентов до 86% сценариев. В мультимодальных настройках универсальные adversarial-примеры (например, картинки) демонстрируют ещё более высокую эффективность, достигая уровней успешности атак, сопоставимых с полноценным джейлбрейками 🚬.
Также показано, что атаки на память и RAG могут иметь долгосрочный эффект, влияя на поведение агента в будущих сессиях при минимальном объёме отравленных данных. Про RAG вообще интересно, а то уже совсем обленились доучивать модели, заменяем рагами и радуемся!

Таким образом, работа не только предлагает концептуальную классификацию, но и подкрепляет её количественными и экспериментальными наблюдениями 😡🤬, демонстрируя и практическую реализуемость описанных угроз и важность пересмотра иб-практик. На почитать жареные факты!

Все!
😋
  • ❤ 8
  • 👍 5
  • 💯 4
  • ❤‍🔥 2
More from @okmlai
  1. Sep 23, 2026Зачем писать стилер, если у пользователя уже есть ИИ-ассистент с доступом ко всему? Патрик…
  2. Sep 21, 2026ИИ получил доступ к своим весам. ЧБД? 16 сентября Irregular опубликовала исследование agen…
  3. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  4. Sep 11, 2026Репозиторий недели. Mantis разделить нельзя объединять 📬 У Google есть Mantis — набор нав…
  5. Sep 9, 2026Пароль сменили. Сессии закрыли. А чужие инструкции остались в памяти ИИ. Именно такой сцен…
  6. Sep 4, 2026AI-агенты начали действовать вне инструкций. Вот что нужно знать разработчикам ⤵️ Недавно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →