Агенты LLM, использующие инструмент, остаются уязвимыми для косвенного внедрения запросов, поскольку надежные инструкции и ненадежные наблюдения имеют общий контекст, что позволяет вредоносному контенту управлять последовательными средствами защиты от фильтрации входных данных. Многопутевые средства защиты на основе консенсуса по-прежнему обеспечивают высокий процент успешных атак, поскольку они анализируют содержимое или агрегированные результаты, а не санкционируют действия, особенно в случае атаки внутри инструмента, когда исходный инструмент сохраняется, но его аргументы подменяются. Контроль потоков данных, такой как CaMeL, дает более надежные гарантии, но требует значительных временных затрат, что ограничивает его практическое применение. Мы представляем ToolFence — систему, которая перед выполнением компилирует типизированный план авторизации, обеспечивает его соблюдение с помощью детерминированного монитора, а в случае неполного плана запрашивает у судьи предоставление новых возможностей, а не выносит решение по каждому конкретному вызову.
https://arxiv.org/abs/2609.37196
Post #476
46