Косвенный ввод запроса внедряет вредоносные инструкции во внешний контент, извлекаемый агентами на основе LLM, изменяя поведение цели без авторизации пользователя. Мы представляем pikit — исследовательский инструментарий, предназначенный для систематической оценки этих угроз по трем основным параметрам: атаки (13 методов), каналы (16 носителей в текстовом и файловом режимах) и средства защиты (9 стратегий предотвращения и 3 базовых метода автономного обнаружения). pikit, основанный на реестре с использованием декораторов, позволяет легко добавлять пользовательские компоненты без изменения основного кода, а унифицированный API craft() позволяет объединять произвольные атаки и каналы в один вызов. Мы протестировали этот инструментарий на агенте pi, работающем на основе анонимной большой языковой модели, в производственной среде. Тестирование 9 стратегий предотвращения атак с высоким уровнем риска показало, что вероятность успешной атаки снижается на 71,8\%.
https://arxiv.org/abs/2609.36817
Post #474
28