TGViewer
maxigacy (AI) Security maxigacy (AI) Security @aixsec · 394 subscribers
Post #32 369
Агент сказал одно. Процесс сделал другое

Защита AI-агента часто заканчивается перед вызовом инструмента: проверили название, аргументы и решение модели — можно выполнять.

Но всё это описывает только намерение агента, а не фактическое поведение процесса.

Авторы свежей работы Hybrid Analysis for Secure MCP Tool Use in LLM Agents предлагают MTGuard — систему, которая проверяет весь жизненный цикл MCP-вызова:

до выполнения → во время → после

До запуска MTGuard анализирует параметры вызова. Во время выполнения собирает события процессов, файловой системы и сети. После сравнивает заявленное действие с тем, что инструмент сделал в действительности.

Например, агент вызывает безопасный navigate(), но на уровне MCP-хоста команда подменяется на чтение /etc/passwd. Проверка аргументов видит обычную навигацию, а runtime-мониторинг — уже реальный процесс.

В экспериментах MTGuard обнаружил 116 из 240 небезопасных вызовов: 48,3%.

Но 48,3% это detection rate, а не доказанная доля предотвращённых атак. В эксперименте решения защиты не блокировали выполнение. Кроме того, post-execution-проверка может скрыть опасный результат от агента, но уже не отменит совершённый сайд эффект.

Есть и цена: два LLM-аудита добавляли в среднем около 12,39 секунды к каждому вызову инструмента.

Поэтому MTGuard не готовая серебряная пуля (опять эти разговоры про серебряную пулю…), а хорошая демонстрация более важного принципа: безопасность AI-агента нельзя строить только вокруг промптов и аргументов.

#AIxSec #AgentSecurity #MCP #RuntimeSecurity #AIxSec_Research #Research #SecurityinAI
  • ❤ 8
  • 👍 3
  • 🔥 3
More from @aixsec
  1. Sep 25, 2026🤖 ИИ уволит аналитиков SOC? На OFFZONE поговорил с Ильёй Крестиничевым из SOC Яндекса о н…
  2. Sep 23, 2026Подключил MCP. Получил SSRF Когда обсуждают безопасность MCP, обычно вспоминают prompt inj…
  3. Sep 21, 2026⚡️ Яндекс обучил собственную LLM с нуля и открыл её веса 19 сентября был на Practical ML C…
  4. Sep 19, 2026Сегодня на Practical ML Conf от Яндекса 👨‍💻 На фото разбирают, как готовят ответы для до…
  5. Sep 18, 2026Уйти из кибербеза пасти гусей 🪿 Даже в театре нашёл с кем поговорить про AI Security 😅 З…
  6. Sep 17, 2026Firewall для tool calls Разрешить агенту инструмент delete_file ещё не значит разрешить уд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →