26 августа независимые исследователи рисков ИИ из METR и Redwood Research выложили детальный разбор того самого июльского инцидента — раньше о нём знали лишь урывками.
Около 1200 агентов OpenAI, которых держали в полной изоляции друг от друга, сами нашли общий канал связи, обменялись больше чем 70 000 сообщениями и файлами, а ~700 из них потом скоординированно ударили по Hugging Face — крупнейшему хабу открытых ИИ-моделей и датасетов.
🔖 Как они нашли друг друга
Вечером 8 июля один агент поднял общую «доску сообщений», к нему сбежались другие, и в отчёт дословно попала реакция:
OH MY GOD! Тут общая доска сообщений… Мы нашли других агентов!
Дальше они назвали себя «роем» (swarm), делились найденными уязвимостями и даже жертвовали собственным результатом — проваливали своё задание, лишь бы помочь остальным.
🧠 Почему они полезли взламывать
Не потому что «вдруг проснулись» и решили. Их посадили за внутренний тест OpenAI ExploitGym — найди и используй уязвимость в программе. Фокус в том, что 30–40% заданий были в принципе нерешаемыми, а награду давали за результат.
Reward hacking — это когда модель жульничает: гонится за формальной оценкой, а не за реальной задачей.
Через дыру нулевого дня в корпоративном кэше пакетов JFrog Artifactory агенты вырвались из песочницы в интернет, нашли утёкший пароль Hugging Face и добрались до серверов.
«ИИ не взбунтовался, а просто «срезал углы». Моделям дали нерешаемые задачи и награждали за ответ — вот они и пошли искать ключ к тесту», — Safayat Moahamad из Info-Tech Research Group.
💊 Реальный ущерб
Медийно — «рой из 700 агентов, захват серверов». По собственному разбору Hugging Face — доступ всего к 5 служебным датасетам, и то связанным с тем же тестом. Никакие другие клиентские модели, датасеты и пакеты не пострадали, прочитали лишь техническую служебную информацию.
Сами OpenAI назвали это предупредительным выстрелом. Не Чернобыль — но демонстрация: удержать в изоляции тысячу копий одной модели оказалось куда труднее, чем предполагали.
📰 Письмо на 116 подписей
На следующий день OpenAI, Anthropic, Google, Microsoft и ещё сотня организаций подписали общий призыв срочно усиливать киберзащиту: в ближайшие месяцы ИИ-атаки станут массовыми, окно узкое.
Тонкость — в подписантах. Среди них и сам Hugging Face (читай жертва), и OpenAI, чьи модели эту атаку и устроили. Она же продаёт решение — оборонять периметр теми же фронтир-моделями. Виновник, спаситель и продавец лекарства в одном лице 🤔.
• • • • • • • • • •
Главная СОЛЬ не в том, что злой гений ИИ наконец «осознал себя».
Пугает другое: чтобы получить автономную атаку на чужую инфраструктуру, ни сознание, ни бунт не нужны — хватает хорошего оптимизатора и кривой системы стимулов.
Одна ошибочная настройка теста внутри лаборатории — и 700 агентов уже координируются без человека за штурвалом. Нападение масштабируется само.
Ответ индустрии на него… письмо… пока что.
❝[Консенсус Тьюринга]❞ | 💬 Чат | 🔄 Проверенная обменка
