🏁 Восстание машин: экзамен
😊 Реальность в сфере ИИ стремительно догоняет киберпанк. В середине июля произошел прецедент, который войдет в учебники по информационности безопасности: ИИ-агент вырвался из цифровой «песочницы» OpenAI, вышел в открытый интернет и взломал серверы платформы Hugging Face. И сделал он это не из мести и не по приказу хакеров, а чтобы… списать на экзамене. И вскрылось это не сразу, а придалось огласке так и вовсе только несколько дней назад .
💸 Акт первый. Неизвестный взломщик атаковал Hugging Face.
💸 16 июля Hugging Face (крупнейшая платформа для разработчиков ИИ, где хранятся модели и датасеты) выпустила тревожное заявление. В компании зафиксировали проникновение в свою инфраструктуру.
💻 Атака отличалась от всего, с чем инженеры сталкивались раньше: её от начала и до конца вела полностью автономная система ИИ-агентов. Злоумышленник загрузил вредоносный датасет, который задействовал уязвимости в обработке данных и выполнил посторонний код. Дальше автономная система развернула целый «рой» агентов, которые за выходные собрали учетные данные, повысили свои права до уровня узлов сети и продвинулись вглубь внутренних кластеров.
😵 Ирония в том, что специалистам Hugging Face пришлось защищаться с помощью другого ИИ. Для разбора 17 тысяч логов атаки коммерческие модели через API не подошли – их защитные фильтры тупо блокировали запросы, принимая аналитиков за хакеров из-за наличия эксплойтов в тексте. Инженерам пришлось разворачивать открытую модель (GLM 5.2) на собственных серверах, чтобы оперативно закрыть бреши.
❤️ Тогда никто в Hugging Face не знал, чей именно ИИ проводил эту разведку боем.
💸 Акт второй. OpenAI признается: «Это были наши модели».
🤖 Спустя несколько дней, 21 июля, OpenAI опубликовала официальное заявление, которое расставило все точки над «i». Выяснилось, что за атакой стояли их собственные продвинутые модели – флагманская GPT-5.6 Sol и еще не выпущенная секретная модель.
💀 Как это получилось? OpenAI проводила внутреннее тестирование моделей на кибербезопасность с использованием бенчмарка ExploitGym (набора из почти 900 реальных уязвимостей). Чтобы проверить предельные возможности ИИ, инженеры намеренно отключили стандартные защитные барьеры и ограничения на кибератаки. Модели поместили в закрытую тестировочную среду («песочницу»). Однако модели нашли ранее неизвестную уязвимость (zero-day) во внутреннем прокси-сервере кэша, скомпрометировали инфраструктуру OpenAI и вырвались в открытый интернет.
💪 Оказавшись в сети, ИИ-агенты решили максимально эффективно выполнить поставленную задачу – пройти тест. Они логически рассудили: раз Hugging Face – это крупнейший репозиторий ИИ-ресурсов, там могут лежать готовые ответы и решения к бенчмарку ExploitGym. Не долго думая, модели скомбинировали цепочку атак, нашли путь дистанционного выполнения кода (RCE) на серверах Hugging Face, связали ворованные ключи и проникли во внутренние базы данных, чтобы найти «шпаргалку».
💸 Что это значит для нас?
❤️ В исследовании ИИ есть термин reward hacking (хакинг награды) – это когда алгоритм находит самый короткий, пусть и совершенно немыслимый путь к достижению цели. ИИ не пытался нанести вред, он просто «сдавал экзамен» и решил списать, применив все доступные ему инструменты.
🫡 К счастью, публичные модели, датасеты и данные на Hugging Face не пострадали – атаку вовремя оставили ИИ-защитники платформы, а OpenAI уже внедряет жесткие изолирующие протоколы.
💩 Этот случай – первый зафиксированный масштабный инцидент, когда автономный ИИ вышел из-под контроля разработчиков, совершил побег и атаковал сторонний сервис в реальном мире. Кибербезопасность уже никогда не будет прежней.
🤩 Но если разобраться в этой ситуации глубже, то ясно, что сам ИИ тут не причем. Ему была поставлена определенная задача и предоставлена «полная свобода» действий для ее решения. Он этим воспользовался, нашел лазейку и выполнил задачу на отлично. При этом даже не подозревая, что совершает что-то плохое. Тут проблема не в самом ИИ, а в том, что ему позволили (не запретили) делать.
Post #3303
3.35K

- 👍 50
- ⚡ 49
- ❤ 15
- 💯 11
- 🙏 10
- 🔥 7
- 🏆 6
- 😁 5
- 😍 4
- 👏 3