Материал предоставил Денис Батранков, в рамках образовательного курса «Директор по кибербезопасности 8.0».
Goal Hijacking через RAG
Косвенная атака: злоумышленник не взаимодействует с системой напрямую. Вредоносные инструкции скрыты в документе, который агент самостоятельно извлечёт из базы знаний при выполнении легитимной задачи.
Меры противодействия Goal Hijacking:
1. Изоляция входных данных
Разделение системного промпта и пользовательского
контента на архитектурном уровне. Документы из RAG не
должны иметь возможности переопределить системные
инструкции.
2. Верификация намерений
Перед выполнением любого действия с внешними эффектами (отправка письма, запись в БД) агент должен
проходить дополнительную проверку намерений.
3. Минимальные привилегии агента
Агент получает только те разрешения, которые необходимы для конкретной задачи. Принцип leastprivilege применяется к каждому инструменту в наборе агента.
4. Мониторинг аномалий
Базовые поведенческие профили для каждого агента. Отклонение от паттерна (новые вызовы API, нетипичный объём данных) — немедленный алерт в SOC.
Goal Hijacking обходит все традиционные средства защиты ввода, поскольку атака происходит не в точке взаимодействия с пользователем.
📩 Как контролировать Shadow AI? Какие риски создают ИИ-агенты? Что потребуется для соответствия новым требованиям регуляторов? Как строить мониторинг и защиту ИИ-систем?
Все эти темы и не только обговариваются на четвертом модуле программы «Директор по кибербезопасности 8.0».
Узнавайте информацию на сайте модуля и присоединяетесь к нашему дружному сообществу! 👏🏻
#ДиректорПоИБ
