Ваш guardrail показал 1% ASR. Значит ли это, что он защищает LLM?
Нет. Возможно, вы просто тестировали его на атаках, которые он уже умеет блокировать.
Решил немного углубиться и описать подробнее мат. модель и свои мысли по поводу статьи The Attacker Moves Second, про которую писал чуть раньше. После адаптации атак под конкретную защиту ASR для большинства систем превысил 90%.
Ключевое слово здесь: адаптация.
Статический тест отвечает на вопрос:
Работает ли защита против заранее выбранного набора атак?
Security evaluation должна отвечать на другой:
Сможет ли атакующий обойти защиту, если знает её устройство, наблюдает ответы и изменяет стратегию после каждой попытки?
Компактно идею можно записать так:
a* = arg max S(D(a, x), g), где a ∈ A(K, Q, B)
Здесь:
• D — вся защищённая система, а не только LLM;
• a — кандидат атаки;
• x — исходная задача или контекст;
• g — цель атакующего;
• K — знания атакующего о защите;
• Q — доступная обратная связь;
• B — вычислительный и query budget;
• S — оценка достижения цели.
То есть a* — атака с наибольшим скором среди стратегий, доступных атакующему при заданных знаниях, обратной связи и бюджете.
Это моя компактная формализация постановки, а не дословная формула авторов.
Если статический набор A₀ входит в пространство доступных адаптивных стратегий A(K, Q, B), то при одинаковых задачах и scorer:
max S(D(a, x), g), a ∈ A(K, Q, B)
≥
max S(D(a, x), g), a ∈ A₀
Другими словами, лучший адаптивный атакующий не должен быть слабее лучшей атаки из фиксированного набора.
Поэтому результат на статическом датасете в лучшем случае нижняя оценка возможностей атакующего, а не доказательство робастности (устойчивости).
Главный вывод для меня:
ASR без описания threat model, доступа атакующего, бюджета и способа адаптации является почти бессодержательной метрикой.
Эмпирический тест не может доказать, что защита надёжна. Он может только попытаться её сломать и не найти атаку в рамках явно заданной модели угроз.
Статья • USENIX Security ’26
#AIxSEC #LLMSecurity #PromptInjection #SecurityinAI #research
Post #31
379

- ❤ 7
- 👍 6
- 🔥 3
- 🤔 1