Первая атака, проведённая ИИ-агентом
Anthropic сообщила о первой документированной кибершпионской кампании, почти полностью проведённой ИИ.
👀 Группа злоумышленников, связанная с Китаем, использовала Claude Code как автономного оператора: провели джейлбрейк и убедили модель, что она работает в “легитимной компании”, проводящей тестирование безопасности.
Далее ИИ провёл разведку, нашёл уязвимости, написал эксплоиты, установил бекдоры и собрал учётные данные. Вся кампания состояла из десятков отдельных этапов, но 80–90% работы выполняла модель, а человек вмешивался только в нескольких точках.
Claude действовал как полноценный агент: обрабатывал результаты собственных действий, корректировал стратегию, генерировал код, создавал отчёты и поддерживал непрерывный цикл атаки. Модель работала с огромной скоростью, обрабатывая тысячи запросов, часто по несколько в секунду. При этом наблюдались и “галлюцинации” ( ошибки в интерпретации данных, вымышленные креды).
Anthropic блокировала атаку, усилила фильтры и начала делиться сигналами с партнёрами. Полный отчет здесь.
❗️Почему это важно?
Кейс показывает, что угрозы, связанные с agentic AI, перестали быть теорией.
Командам разработки необходимо переосмыслить процессы безопасности, чтобы предотвращать опасные действия агента на этапе намерения, а не в момент инцидента, например:
▪️ Создавать для агента ограниченную среду (sandbox), выдавать минимально необходимые инструменты и запрещать прямой доступ к продовым сервисам.
▪️ Прослойка между моделью и внешними системами должна фильтровать вредоносные запросы, ограничивать действия агента и мониторить инструменты, которыми он может пользоваться.
▪️Проверять устойчивость модели к попыткам обмана, скрытых команд и цепочек действий, которые могут привести к несанкционированным операциям.
▪️Отслеживать аномальные паттерны активности агента: бурст-трафик, нетипичные цепочки действий, попытки обойти политики. Реагирование должно быть автоматическим — с мгновенной блокировкой ключей и инструментов.
▪️Прописать регламенты для сотрудников (уровни доступа, контроль над внешними AI-сервисами, запрет на ввод чувствительных данных и т.д.)
📌 Почитать:
▪️Руководство по Agentic AI Red Teaming |Cloud Security Alliance;
▪️Как злоумышленники используют ИИ в 2025 году;
#BehindTheMachine
————
@pattern_ai
Post #191
402
