Агент сказал одно. Процесс сделал другое
Защита AI-агента часто заканчивается перед вызовом инструмента: проверили название, аргументы и решение модели — можно выполнять.
Но всё это описывает только намерение агента, а не фактическое поведение процесса.
Авторы свежей работы Hybrid Analysis for Secure MCP Tool Use in LLM Agents предлагают MTGuard — систему, которая проверяет весь жизненный цикл MCP-вызова:
до выполнения → во время → после
До запуска MTGuard анализирует параметры вызова. Во время выполнения собирает события процессов, файловой системы и сети. После сравнивает заявленное действие с тем, что инструмент сделал в действительности.
Например, агент вызывает безопасный navigate(), но на уровне MCP-хоста команда подменяется на чтение /etc/passwd. Проверка аргументов видит обычную навигацию, а runtime-мониторинг — уже реальный процесс.
В экспериментах MTGuard обнаружил 116 из 240 небезопасных вызовов: 48,3%.
Но 48,3% это detection rate, а не доказанная доля предотвращённых атак. В эксперименте решения защиты не блокировали выполнение. Кроме того, post-execution-проверка может скрыть опасный результат от агента, но уже не отменит совершённый сайд эффект.
Есть и цена: два LLM-аудита добавляли в среднем около 12,39 секунды к каждому вызову инструмента.
Поэтому MTGuard не готовая серебряная пуля (опять эти разговоры про серебряную пулю…), а хорошая демонстрация более важного принципа: безопасность AI-агента нельзя строить только вокруг промптов и аргументов.
#AIxSec #AgentSecurity #MCP #RuntimeSecurity #AIxSec_Research #Research #SecurityinAI
Post #32
369

- ❤ 8
- 👍 3
- 🔥 3