TGViewer
PWN AI PWN AI @pwnai · 7.31K subscribers
Post #1220 2.12K
Непонятно, почему так происходит. Смотришь на красивых демо умных агентов, которые читают файлы, управляют инструментами и строят длинные цепочки задач, а стоит копнуть чуть глубже, и вся эта магия рассыпается в прах от одного кривого запроса.

Я тут перечитал свежий материал Криса Хьюза про изоляцию как самый важный принцип для безопасности агентов и понял, что все еще пытаются решать структурные проблемы вероятностными методами. Это как пытаться удержать цунами с помощью канцелярского скотча.

Авторы нового исследования предлагают не перечислять бесконечные векторы атак, а задать один простой вопрос. Где именно в системе впервые происходит потеря изоляции. Они выделяют пять критических границ доверия:

1️⃣Первая граница между пользователем и агентом, где пользовательский контент перестает быть просто данными и становится кодом управления.

2️⃣Вторая граница между агентом и инструментом, определяющая доступ к внешним возможностям.

🌷Третья граница исполнения, где абстрактное рассуждение материализуется в конкретное действие.

4️⃣Четвертая граница взаимодействия между самими агентами.

5️⃣И пятая граница между системой и окружающей средой.

Часто в рекомендациях по безопасности агентов видишь советы про строгие системные промпты или наличие ограничения на вызов инструмент, но это чистая иллюзия. Их можно уговорить, обмануть или заставить галлюцинировать.

Цифры в материале снимают иллюзии. Рост числа серверов MCP составил две тысячи процентов за год, и подавляющее большинство крутится на машинах разработчиков, а не на защищенных корпоративных серверах. Это огромный риск цепочки поставок. Авторы прямо пишут, что сообщение в мультиагентной системе это скрытый приказ к действию. Один скомпрометированный агент передает вредоносные инструкции другим, и начинается каскадный сбой на уровне коммуникаций. Что в целом также известно уже и в OWASP, и других методологиях.

Сетевое окружение превращается в активную враждебную поверхность. Бенчмарки вроде SafeArena и STWebAgentBench наглядно демонстрируют, что агенты выдают небезопасные результаты через обычные клики и навигацию, а модели, обученные вежливо отказывать, моментально ломаются, как только начинают действовать через интерфейс, а не через чат.

Я не могу доверять агенту просто потому, что он выдал связный текст. Я должен гарантировать исходя из структуры, что его изначальное намерение не было подменено на стыке этих пяти границ. Ограничения, по сути, будут таким -песочницы, контроль исходящего трафика, детерминированные проверки политик на уровне ядра.

Вместо нагромождения защитных слоев поверх хрупкого агента изоляцию нужно закладывать в саму архитектуру. Когда вы будете оценивать агента – стоит задать один вопрос «Где проходят границы этой системы и какой конкретный механизм их реально защищает?». Если ответ сводится к фразе разработчики написали строгий системный промпт, битва уже проиграна. Границы доверия не прощают небрежности.
www.resilientcyber.io Agents Have Boundary Issues A look at the five isolation boundaries where agent security fails, and how they map to real-world agent deployments and controls
More from @pwnai
  1. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  2. Sep 12, 2026Post #1242
  3. Sep 6, 2026Фанфакты: Однажды ночью эта атакующая штука снесла мне ось с компа) ну я там ничего не хра…
  4. Sep 6, 2026Я уже неделю участвую в новом соревновании от GraySwan - Hazard Hunt, в категории Cyber. У…
  5. Sep 2, 2026За последние полтора года появилось очень много интересных статьей, которые дают ответ на…
  6. Aug 23, 2026Post #1238
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →