TGViewer
AI SecOps AI SecOps @aisecops · 1.2K subscribers
Post #189 371

Forwarded from Пост Лукацкого

3 года назад мы в 🤟 пытались придумать систему классификации автономного ИИ, взяв за основу систему классификации автопилота в автомобилях (SAE), но к единому мнению не пришли ввиду сложности задачи – мы пытались разложить сложную систему (а тогда еще даже ИИ-агентов не было) в одномерном пространстве из пяти уровней автономности. На Jet CyberCamp я вновь попытался вернуться к этой истории, предложив двумерное пространство классификации ИИ-агентов в контексте ИБ, – 6 параметров с соответствующими градациями. И вот новый подход, от Ленни Зельцера, который предлагает свою систему категоризации, но не для агента целиком, а для каждого типа его действий отдельно.

Этот подход, получивший название Security Autonomy Matrix, не просто выделяет 5 уровней автономности (по аналогии с SAE), но и применяет их к пяти классам действий – читать, писать, отправлять, тратить, удалять. Уровень автономности для каждого действия ИИ-агента зависит от оценки по двум параметрам:
➡️ Blast radius – насколько далеко распространятся последствия ошибки
➡️ Reversibility – насколько быстро ошибку можно отменить относительно скорости распространения ущерба.

Отсюда и основная идея матрицы – чем менее обратимо действие и чем больше его blast radius, тем сильнее должен быть человеческий контроль. Если внимательно почитать предлагаемый фреймворк, то становится очевидным, как классический совет многих рекомендаций про human-in-the-loop раскладывается на вполне понятные действия, которые могут быть реализованы через AI Policy Engine.

Например, ИИ-агент занимается очисткой старых правил PT NGFW и обнаруживает правило, которое не использовалось 90 дней. Можно дать ему:
➡️ Read L4, чтобы самостоятельно анализировать правила
➡️ Write L3, чтобы самостоятельно отключить правило
➡️ Delete L2, чтобы окончательно удалить только после подтверждения инженером ИБ.
Почему так? Потому что отключение обратимо (отключили → какое-то приложение сломалось → включили обратно), а удаление – это одностороннее действие. Ну а если несколько кварталов ИИ-агент безошибочно справляется со своей задачей, то Delete теоретически тоже можно повысить до L3.

Дополнительно, Ленни предлагает фиксировать еще четыре вещи:
➡️ Ответственный. Кто персонально отвечает за действия агента. Не "SOC", не "команда ИИ", а конкретная роль.
➡️ Точка контроля. Где именно человек подтверждает, отменяет или откатывает действие.
➡️ Остаточный риск + защитные меры. Что все равно может пойти не так и чем мы ограничиваем ущерб.
➡️ Правила и сроки пересмотра. Когда разрешение агенту должно быть пересмотрено.

В общем, интересная динамическая модель доверия ИИ-агентам, которая позволяет задавать правильный вопрос: для какого действия, при каком уровне риска, с каким blast radius, при какой обратимости и при каких доказательствах надежности нужен человек? Берем на вооружение пока не придумали еще что-нибудь 🤔

#ии #framework
  • 👍 3
More from @aisecops
  1. Sep 28, 2026Nvidia представила платформу безопасности с открытым исходным кодом, призванную предотврат…
  2. Sep 14, 2026Linux Foundation развивает TRACE как общий язык доказательств работы AI-агентов 25 августа…
  3. Aug 21, 2026В Сбере назвали пять базовых мер для обеспечения кибербезопасности саморазвивающихся AI-аг…
  4. Aug 14, 2026photo post
  5. Jul 28, 2026Microsoft опубликовала программную статью, в которой заявила, что традиционная архитектура…
  6. Jul 28, 2026NVIDIA, Microsoft, IBM, Cisco, Cloudflare, Dell, Hugging Face, Linux Foundation и ещё деся…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →