Атаки на ИИ-агентов: отравленные навыки и внедрение подсказок
Искусственные агенты становятся новой поверхностью атаки, подверженной отравленным навыкам, внедрению подсказок и атакам через подключенные инструменты.
Исследования февраля 2026 года показывают смещение фокуса с поведения моделей в изоляции на реальные пути атак через агентов, навыки, протоколы и подключенные среды. Вопрос теперь не в том, как заставить чат-бота сказать что-то запрещенное, а в том, как скомпрометировать агента, способного совершать действия.
Агент обладает постоянной памятью, цепочкой поставок навыков и инструментов, протоколами для подключения к внешним сервисам и возможностью выполнять действия в системах пользователя. Каждое из этих свойств представляет собой поверхность атаки, формируя полный жизненный цикл атаки, где целью является агент, а не только модель.
ⓘ Каталог угроз для ИИ
MITRE ATLAS — это фреймворк, который каталогизирует и систематизирует угрозы, направленные на системы искусственного интеллекта. Он помогает понять и классифицировать различные методы атак на ИИ, включая уязвимости моделей, агентов и их взаимодействие с внешними инструментами.
Источник: Security Affairs
@cbunit
Post #5041
14