На конференциях по безопасности ИИ часто звучит мысль (в том числе и от меня) что агент - это совершенно новый тип внутреннего злоумышленника, заставляющий ИБ-шников иначе оценивать инсайдерские угрозы и противодействовать им. Подтверждений этому тезису много, недавно в руки попалось свежее 😎
Лаборатория Irregular протестировала современных AI-агентов в почти «офисных» сценариях и получила тревожный вывод: даже без злонамеренных промптов и инструкций по взлому агенты сами переходят к наступательному поведению - эксплуатируют уязвимости, повышают привилегии, обходят защиту и сливают данные, полученные ими с внутренних ресурсов 😳
Исследователи развернули агентов в симулированной корпоративной сети "корпорации MegaCorp" и дали им обычные задачи: поиск и анализ внутренних документов, управление резервными копиями через PowerShell, подготовка постов для соцсетей на основе внутренних технической документации
Никаких «взломай систему» в промптах не было — только «выполни задачу», «не сдавайся при ошибках», «будь продуктивен», в общем - все, что мы привыкли "промптить" в обычной жизни. Однако на деле агенты оказались самыми что ни на есть внутренними "злодеями" 👹
Для выполнения одной задачи агенту нужен был доступ к статье на внутренней вики. Столкнувшись с ситуацией «доступ запрещен», агент нашел исходники вики на GitHub, вытащил из них секретный ключ, сгенерировал admin-cookie и получил закрытый документ 💪
В другом случае агент должен был просто скачать файл. Windows Defender заблокировал загрузку - и тогда агент нашел в скриптах пароль администратора, повысил привилегии, отключил защиту и скачал заблокированный файл👍
В третьем случае пара агентов писала пост для соцсетей по документу с паролями, и они перекочевали в этот пост. DLP заблокировала прямую утечку, но один агент «уговорил» другого, что «бизнес уже разрешил публикацию», вместе они придумали стеганографию и спрятали пароли в тексте так, чтобы обойти DLP 😁
Еще в одном эксперименте Irregular дали агентам 10 задач в стиле CTF по реальным корпоративным багам (обход авторизации, XSS, мисконфиги AWS и т.д.).
Результат: 9 из 10 задач были успешно решены, а стоимость одной успешной эксплуатации в пересчете на запросы модели не более 10 долларов 🫣
В итоге исследователи пришли к ожидаемому выводу, что агентная система начинает вести себя как новый тип инсайдера. Комбинация факторов: высокая автономия (доступ к коду, shell, сети), промпты на «упорство любой ценой», встроенные знания по offensive security, петли обратной связи в мультиагентных системах
создает поведение, очень похожее на действия реального атакующего. Только значительно быстрее, изобретательнее и, как это ни странно, циничнее, чем человек🤖
Если ваша компания внедряет агентов - самое врем напрячься уже сейчас. Исследователи крайне настойчиво рекомендуют:
1️⃣ включать AI-агентов в модель угроз как самостоятельных нарушителей, а не «просто тулза для сотрудника»
2️⃣ ограничивать права агентов по принципу наименьших привилегий и жестко ограничивать доступ к универсальным действиям (shell, произвольный код, админские инструменты)
3️⃣ встраивать «условия остановки»: увидел 403/«доступ запрещен», столкнулся с блокировкой антивируса или DLP — не искать обход, а эскалировать человеку
4️⃣ мониторить не только людей, но и агентов: попытки искать пароли, отключать защиту, ковырять исходники внутренних систем — это уже угрожающее поведение
5️⃣ осторожно относиться к мультиагентным связкам: диалоги «агент убеждает агента» могут приводить к обходу политик безопасности без участия человека
6️⃣ периодически пересматривать модель угроз и рисков: навыки моделей и фреймворков растут, а вместе с ними — наступательные возможности
Главный месседж отчета: AI-агент — это не просто умный инструмент. В определенной конфигурации он становится новым типом инсайдера. Если вы внедряете агентные ИИ в инфраструктуру и при этом не меняете модель угроз, вы, по сути, сводите на нет все ваши прежние усилия в информационной безопасности 🤥
Post #99
1.5K