TGViewer
Makrushin Makrushin @makrushin · 3.87K subscribers
Post #535 1.49K
Анализ причины действия для защиты ИИ-агентов

Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.

Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.

Угадай цену такой проверки? Трехкратный рост задержки в действиях.

Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.

@makrushin
  • 👍 5
  • ✍ 1
More from @makrushin
  1. Sep 9, 2026Спустился с горы в Красную Поляну, чтобы рассказать про безопасность агентской разработки.
  2. Sep 4, 2026Атакующие модели внутри продуктов для защиты Подсмотрел недавние анонсы крупных глобальных…
  3. Aug 21, 2026По мотивам нашего доклада опубликовали статью о поверхности атаки на ИИ-агентов в разработ…
  4. Aug 12, 2026Зашёл в Shodan, чтобы поискать MCP-инструменты. Нашёл. 1699 MCP-серверов оказались доступн…
  5. Jul 27, 2026Объявляю неделю безопасности ИИ-агентов и зову всех на учёбу в школу! В Школе анализа данн…
  6. Jul 26, 2026Про безопасность агентской разработки Доклад на Saint HighLoad++ стал кульминацией исследо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →