TGViewer
Pattern AI Pattern AI @pattern_ai · 402 subscribers
Post #191 402
Первая атака, проведённая ИИ-агентом

Anthropic сообщила о первой документированной кибершпионской кампании, почти полностью проведённой ИИ.

👀 Группа злоумышленников, связанная с Китаем, использовала Claude Code как автономного оператора: провели джейлбрейк и убедили модель, что она работает в “легитимной компании”, проводящей тестирование безопасности.
Далее ИИ провёл разведку, нашёл уязвимости, написал эксплоиты, установил бекдоры и собрал учётные данные. Вся кампания состояла из десятков отдельных этапов, но 80–90% работы выполняла модель, а человек вмешивался только в нескольких точках.
Claude действовал как полноценный агент: обрабатывал результаты собственных действий, корректировал стратегию, генерировал код, создавал отчёты и поддерживал непрерывный цикл атаки. Модель работала с огромной скоростью, обрабатывая тысячи запросов, часто по несколько в секунду. При этом наблюдались и “галлюцинации” ( ошибки в интерпретации данных, вымышленные креды).

Anthropic блокировала атаку, усилила фильтры и начала делиться сигналами с партнёрами. Полный отчет здесь.

❗️Почему это важно?
Кейс показывает, что угрозы, связанные с agentic AI, перестали быть теорией.

Командам разработки необходимо переосмыслить процессы безопасности, чтобы предотвращать опасные действия агента на этапе намерения, а не в момент инцидента, например:
▪️ Создавать для агента ограниченную среду (sandbox), выдавать минимально необходимые инструменты и запрещать прямой доступ к продовым сервисам.
▪️ Прослойка между моделью и внешними системами должна фильтровать вредоносные запросы, ограничивать действия агента и мониторить инструменты, которыми он может пользоваться.
▪️Проверять устойчивость модели к попыткам обмана, скрытых команд и цепочек действий, которые могут привести к несанкционированным операциям.
▪️Отслеживать аномальные паттерны активности агента: бурст-трафик, нетипичные цепочки действий, попытки обойти политики. Реагирование должно быть автоматическим — с мгновенной блокировкой ключей и инструментов.
▪️Прописать регламенты для сотрудников (уровни доступа, контроль над внешними AI-сервисами, запрет на ввод чувствительных данных и т.д.)

📌 Почитать:
▪️Руководство по Agentic AI Red Teaming |Cloud Security Alliance;
▪️Как злоумышленники используют ИИ в 2025 году;

#BehindTheMachine
————
@pattern_ai
More from @pattern_ai
  1. Sep 24, 2026Что уже делают AI-агенты? OECD опубликовала документ об использовании агентного ИИ в орган…
  2. Sep 21, 2026ИИ-агент впервые оказался в уведомлении об утечке персональных данных Испанское агентство…
  3. Sep 18, 2026Требования новой инициативы EU KIDS Act Интересное получилось "совпадение". 8 сентября OEC…
  4. Sep 17, 2026Результаты проверки Ray-Ban Meta от немецкого регулятора Про ассиметрию осведомленности пр…
  5. Sep 16, 2026Кто на самом деле читает ваши диалоги с ChatGPT? Уже обсуждали в постах, что OpenAI может…
  6. Sep 2, 2026AI&Online Safety Law Tracker еще один полезный ресурс от энтузиастов с подборкой законов в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →