TGViewer
AI Attacks AI Attacks @aiattacks · 1.02K subscribers
Post #476 46
Агенты LLM, использующие инструмент, остаются уязвимыми для косвенного внедрения запросов, поскольку надежные инструкции и ненадежные наблюдения имеют общий контекст, что позволяет вредоносному контенту управлять последовательными средствами защиты от фильтрации входных данных. Многопутевые средства защиты на основе консенсуса по-прежнему обеспечивают высокий процент успешных атак, поскольку они анализируют содержимое или агрегированные результаты, а не санкционируют действия, особенно в случае атаки внутри инструмента, когда исходный инструмент сохраняется, но его аргументы подменяются. Контроль потоков данных, такой как CaMeL, дает более надежные гарантии, но требует значительных временных затрат, что ограничивает его практическое применение. Мы представляем ToolFence — систему, которая перед выполнением компилирует типизированный план авторизации, обеспечивает его соблюдение с помощью детерминированного монитора, а в случае неполного плана запрашивает у судьи предоставление новых возможностей, а не выносит решение по каждому конкретному вызову.

https://arxiv.org/abs/2609.37196
arXiv.org ToolFence: Fine-Grained Authorization for Secure Tool-Using LLM Agents Tool-using LLM agents remain vulnerable to indirect prompt injection because trusted instructions and untrusted observations share one context, allowing malicious content to steer consequential...
More from @aiattacks
  1. Sep 30, 2026Раз в неделю я делаю ресерч по новым продуктам, лабораторным в том числе, в ИБ в ML, в ML…
  2. Sep 30, 2026Теперь не только можно купить ВПО, но еще заказать аналитику, чтобы не тратить ресурсы зря…
  3. Sep 30, 2026красиво Северокорейская схема по внедрению фальшивых ИТ-специалистов в западные компании б…
  4. Sep 30, 2026а вот это даже не хе-хе, а Хе-хе-хе (Хуанг мой краш, конечно ) На фоне растущей обеспокоен…
  5. Sep 30, 2026Операторы Kubernetes призваны значительно сократить операционную нагрузку, выступая в роли…
  6. Sep 30, 2026DARWIN рассматривает джейлбрейк как непрерывный эволюционный процесс и постоянно обновляет…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →