TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #813 225
🧨 Граница доверия LLM.

На arXiv вышла работа Composable Trust for Language Models, где авторы предлагают отказаться от идеи «исправить модель», а вместо этого предланают изменить архитектуру агентных систем.

⚙️ Граница доверия становится частью архитектуры

Авторы вводят понятие Composable Trust, формальной границы доверия (trust boundary), которая задаётся для каждого компонента пайплайна вокркг LLM.

Например:
🔹 RAG может предоставлять информацию, но не инициировать tool calls;
🔹 системный промпт имеет право задавать политики безопасности;
🔹 пользовательские инструкции не могут менять права доступа;
🔹 результаты поиска используются только как данные, а не как инструкции для выполнения.

При добавлении нового компонента, например MCP-сервера, общая trust boundary пересчитывается.

🧠 Как измеряют защиту?

Авторы разделяют доказуемую безопасность и измеряемую эффективность.

Критические решения принимает не сама LLM, а внешний Trust Monitor, детерминированный компонент, который отслеживает происхождение каждого фрагмента контекста и присваивает ему уровень доверия. Если запрос на вызов инструмента сформирован данными из недоверенного источника, monitor блокирует действие независимо от того, что решила модель.

После этого измеряется эффективность защиты.

В экспериментах на Gemma 3 27B комбинация Trust Monitor и механизма passivation увеличила показатель Genuine Leak Defended Rate примерно с 27% до 94%, при этом качество обычных ответов практически не изменилось (QRel ≈ 0.96). Даже при адаптивных атаках защита сохраняла около 87% успешных блокировок, а корректная атрибуция данных из недоверенных источников достигала 92%.

🛡️ Простота в действии

Практически все современные средства защиты пытаются сделать модель «умнее»: обучить новым jailbreak, добавить guardrails или улучшить системный промпт.

Авторы данного исследования предлагают противоположный подход. LLM больше не должна принимать решения о доверии. Её задача исключительно генерировать текст. Всё, что связано с доступом к инструментам, данным и выполнением действий, должно контролироваться проверяемым кодом за пределами модели.

🔗 Исследование: https://arxiv.org/abs/2607.13149

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #LLM #AgenticAI #AISecurity #PromptInjection #TrustBoundary #RuntimeSecurity #AppSec #SecureTechTalks
  • ❤ 1
  • 👍 1
More from @securetechtalks
  1. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  2. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  3. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  4. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  5. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
  6. Sep 24, 2026🧨 CLOSEDQUORUM: вредоносное ПО передало управление атакой совету из четырёх LLM Cisco Tal…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →