TGViewer
AI Attacks AI Attacks @aiattacks · 1.01K subscribers
Post #413 171
Безопасность ИИ‑агентов должна обеспечиваться не за счёт обучения модели, а через контракт во время выполнения — с помощью механизмов профилактики и проверки доказательств.

Авторы выделяют две составляющие контракта безопасности:
Профилактическая — блокирует опасные действия до их совершения. Включает песочницы, системы разрешений, фильтры вывода и мониторы траектории.
Доказательная — требует верифицируемых доказательств того, что безопасные действия действительно выполнены. Например, запуск тестов, захват логов, сравнение файлов, проверка цитирования.

В документе описаны пять несоответствий между обучением моделей и реальным развёртыванием агентов:
-использование статистических прокси вместо формальных спецификаций;
-обучение на ограниченном наборе данных в противовес работе в «открытом мире»;
-невозможность проверить внутренний монолог модели в отличие от воспроизводимой траектории действий;
-правдоподобные, но неверные выходные данные модели против проверяемых доказательств (например, результатов тестов);
-единый уровень защиты модели против многослойной системы безопасности.

https://arxiv.org/pdf/2608.11274
More from @aiattacks
  1. Sep 24, 2026ИИ-агенты взломали 27 компаний и украли данные 600 тысяч банковских карт Всего за 5 дней з…
  2. Sep 21, 2026Исследователи из компании Hacktron, специализирующейся на кибербезопасности, использовали…
  3. Sep 21, 2026Как выбирать проекты на гитхабе, когда все вайбкодят. Статья, конечно, слоп. Но в основном…
  4. Sep 21, 2026PentestChain — десятиэтапную автоматизированную систему тестирования на проникновение, кот…
  5. Sep 21, 2026Читала вот эту статью https://cyberscoop.com/ai-agent-hacking-apocalypse-cybersecurity/ Вс…
  6. Sep 21, 2026Непрямое внедрение запросов (IPI) остаётся центральной проблемой безопасности LLM: в станд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →