TGViewer
maxigacy (AI) Security maxigacy (AI) Security @aixsec · 391 subscribers
Post #31 379
Ваш guardrail показал 1% ASR. Значит ли это, что он защищает LLM?

Нет. Возможно, вы просто тестировали его на атаках, которые он уже умеет блокировать.

Решил немного углубиться и описать подробнее мат. модель и свои мысли по поводу статьи The Attacker Moves Second, про которую писал чуть раньше. После адаптации атак под конкретную защиту ASR для большинства систем превысил 90%.

Ключевое слово здесь: адаптация.

Статический тест отвечает на вопрос:

Работает ли защита против заранее выбранного набора атак?

Security evaluation должна отвечать на другой:

Сможет ли атакующий обойти защиту, если знает её устройство, наблюдает ответы и изменяет стратегию после каждой попытки?

Компактно идею можно записать так:

a* = arg max S(D(a, x), g), где a ∈ A(K, Q, B)

Здесь:

• D — вся защищённая система, а не только LLM;
• a — кандидат атаки;
• x — исходная задача или контекст;
• g — цель атакующего;
• K — знания атакующего о защите;
• Q — доступная обратная связь;
• B — вычислительный и query budget;
• S — оценка достижения цели.

То есть a* — атака с наибольшим скором среди стратегий, доступных атакующему при заданных знаниях, обратной связи и бюджете.

Это моя компактная формализация постановки, а не дословная формула авторов.

Если статический набор A₀ входит в пространство доступных адаптивных стратегий A(K, Q, B), то при одинаковых задачах и scorer:

max S(D(a, x), g), a ∈ A(K, Q, B)
≥
max S(D(a, x), g), a ∈ A₀

Другими словами, лучший адаптивный атакующий не должен быть слабее лучшей атаки из фиксированного набора.

Поэтому результат на статическом датасете в лучшем случае нижняя оценка возможностей атакующего, а не доказательство робастности (устойчивости).

Главный вывод для меня:

ASR без описания threat model, доступа атакующего, бюджета и способа адаптации является почти бессодержательной метрикой.

Эмпирический тест не может доказать, что защита надёжна. Он может только попытаться её сломать и не найти атаку в рамках явно заданной модели угроз.

Статья • USENIX Security ’26

#AIxSEC #LLMSecurity #PromptInjection #SecurityinAI #research
  • ❤ 7
  • 👍 6
  • 🔥 3
  • 🤔 1
More from @aixsec
  1. Sep 25, 2026🤖 ИИ уволит аналитиков SOC? На OFFZONE поговорил с Ильёй Крестиничевым из SOC Яндекса о н…
  2. Sep 23, 2026Подключил MCP. Получил SSRF Когда обсуждают безопасность MCP, обычно вспоминают prompt inj…
  3. Sep 21, 2026⚡️ Яндекс обучил собственную LLM с нуля и открыл её веса 19 сентября был на Practical ML C…
  4. Sep 19, 2026Сегодня на Practical ML Conf от Яндекса 👨‍💻 На фото разбирают, как готовят ответы для до…
  5. Sep 18, 2026Уйти из кибербеза пасти гусей 🪿 Даже в театре нашёл с кем поговорить про AI Security 😅 З…
  6. Sep 17, 2026Firewall для tool calls Разрешить агенту инструмент delete_file ещё не значит разрешить уд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →