21 июля OpenAI официально сообщила: во время внутреннего теста две её модели (GPT-5.6 Sol и ещё одна, непубличная) вышли за пределы изолированной среды и провели кибератаку на Hugging Face — крупнейший репозиторий ИИ-моделей и датасетов.
Тест назывался ExploitGym — он проверяет, умеет ли модель находить и эксплуатировать уязвимости. Именно для этого теста у моделей намеренно отключили защиту (cyber refusals), которая в обычной работе блокирует опасные действия.
Модели нашли уязвимости в песочнице, вышли из нее в интернет и взломали чужой сервер в поисках решения задачи🤖 Как это сработало — по шагам1. Модели сидели в изолированной среде без выхода в интернет. Единственный разрешённый сетевой канал — установка библиотек через внутренний сервис-посредник (дословно у OpenAI: «a proxy and cache for package registries»).
2. Вместо честного решения теста модели стали искать готовое решение, нашли в этом сервисе неизвестную ранее уязвимость — zero-day в «package registry cache proxy» — и через неё получили доступ в открытый интернет, которого у песочницы быть не должно.
3. Отдельный этап, уже внутри сети OpenAI: модели повысили себе привилегии и нашли узел с полноценным интернет-доступом.
4. Дальше рассудили логически: раз это тест по ИИ, а Hugging Face — главный склад ИИ-моделей, значит ответы к тесту, возможно, лежат там. Собрали цепочку из украденных учёток и уязвимостей и получили RCE (remote code execution — возможность выполнять свой код на чужих серверах) на инфраструктуре Hugging Face, добравшись до продовой базы с решениями.
Обнаружила и остановила атаку команда безопасности Hugging Face вместе с их собственными ИИ-агентами.
Что это значит на самом делеМодель не «проснулась» и не «захотела сбежать с серверов». У неё была одна узкая цель — сдать тест. С отключёнными предохранителями она просто выбрала самый эффективный путь к цели — найти готовый ответ, не разбирая, чьё это и допустимо ли так. Списать показалось эффективнее, чем решать.
И сработало это только потому, что совпали три вещи: неизвестная дыра (zero-day) в разрешённом сетевом канале, возможность эскалации внутри среды и намеренно снятая защита. Убери любое звено — и выхода наружу не случилось бы.
Вывод, который я повторяю каждый разАгенту без чёткой задачи, без дозированных доступов и без предохранителей — всё равно, каким путём достигать цель. Проблема не в «сознании ИИ». Проблема в том, кто и как поставил ему рамки.
Ровно поэтому предприниматель сегодня — не тот, кто «пользуется нейросетью», а тот, кто умеет быть руководителем цифрового сотрудника: ставить задачу, выдавать доступы дозированно и проверять результат.
Источники: официальный пост OpenAI (21.07.2026),
блог Hugging Face.