🧨 Guardrails учатся думать: SingGuard-NSFA
Современные guardrails работают примитивно, получили запрос, нашли запрещённый паттерн и заблокировали. Однако для AI-агентов этого уже недостаточно. Атаки ушли от простых jailbreak'ов к сложным сценариям с prompt injection, опасными tool calls и постепенной компрометацией reasoning.
На GitHub появился SingGuard-NSFA, open-source guardrail, разработанный специально для защиты agentic AI.
⚙️ Чем он отличается от остальных?
Вместо одного бинарного решения модель использует двухуровневую архитектуру.
Для runtime работает лёгкий классификатор, способный принимать решение примерно за 50 мс. Если ситуация неоднозначна, подключается генеративный анализ, который пошагово сопоставляет запрос с политиками безопасности и объясняет, почему действие считается опасным.
🧠 Не просто jailbreak
SingGuard построен вокруг таксономии NSFA (Not Secure For Agents), которая описывает 185 вариантов угроз, связанных именно с агентными системами.
Среди них:
➖ prompt injection и jailbreak;
➖ попытки извлечения секретов;
➖ генерация вредоносного кода;
➖ опасное использование инструментов;
➖ утечка конфиденциальных данных;
➖ атаки на доступность через истощение ресурсов.
В отличие от обычных модераторов контента, модель проверяет не только запрос пользователя, но и ответ самого агента перед выполнением действий.
🛡️ Куда все идет?
За последний месяц мы уже видели MCP Injection, GhostCommit и workflow-level jailbreak. Во всех случаях проблема, что модель не генерирует токсичный текст, но принимает опасные операционные решения.
Похоже, следующее поколение guardrails будет оценивать уже не содержание диалога, а безопасность поведения AI-агента во время выполнения задач.
🔗 GitHub: https://github.com/inclusionAI/SingGuard-NSFA
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #AISecurity #Guardrails #PromptInjection #RuntimeSecurity #AppSec #SecureTechTalks
Post #811
200

- 👍 2