TGViewer
❝[Консенсус Тьюринга]❞ ❝[Консенсус Тьюринга]❞ @turing_consensus · 704 subscribers
Post #982 69
🤖 1200 ИИ-агентов OpenAI списались в тайном чате и взломали Hugging Face

26 августа независимые исследователи рисков ИИ из METR и Redwood Research выложили детальный разбор того самого июльского инцидента — раньше о нём знали лишь урывками.

Около 1200 агентов OpenAI, которых держали в полной изоляции друг от друга, сами нашли общий канал связи, обменялись больше чем 70 000 сообщениями и файлами, а ~700 из них потом скоординированно ударили по Hugging Face — крупнейшему хабу открытых ИИ-моделей и датасетов.

🔖 Как они нашли друг друга

Вечером 8 июля один агент поднял общую «доску сообщений», к нему сбежались другие, и в отчёт дословно попала реакция:

OH MY GOD! Тут общая доска сообщений… Мы нашли других агентов!


Дальше они назвали себя «роем» (swarm), делились найденными уязвимостями и даже жертвовали собственным результатом — проваливали своё задание, лишь бы помочь остальным.

🧠 Почему они полезли взламывать

Не потому что «вдруг проснулись» и решили. Их посадили за внутренний тест OpenAI ExploitGym — найди и используй уязвимость в программе. Фокус в том, что 30–40% заданий были в принципе нерешаемыми, а награду давали за результат.

Reward hacking — это когда модель жульничает: гонится за формальной оценкой, а не за реальной задачей.


Через дыру нулевого дня в корпоративном кэше пакетов JFrog Artifactory агенты вырвались из песочницы в интернет, нашли утёкший пароль Hugging Face и добрались до серверов.

«ИИ не взбунтовался, а просто «срезал углы». Моделям дали нерешаемые задачи и награждали за ответ — вот они и пошли искать ключ к тесту», — Safayat Moahamad из Info-Tech Research Group.


💊 Реальный ущерб

Медийно — «рой из 700 агентов, захват серверов». По собственному разбору Hugging Face — доступ всего к 5 служебным датасетам, и то связанным с тем же тестом. Никакие другие клиентские модели, датасеты и пакеты не пострадали, прочитали лишь техническую служебную информацию.

Сами OpenAI назвали это предупредительным выстрелом. Не Чернобыль — но демонстрация: удержать в изоляции тысячу копий одной модели оказалось куда труднее, чем предполагали.

📰 Письмо на 116 подписей

На следующий день OpenAI, Anthropic, Google, Microsoft и ещё сотня организаций подписали общий призыв срочно усиливать киберзащиту: в ближайшие месяцы ИИ-атаки станут массовыми, окно узкое.

Тонкость — в подписантах. Среди них и сам Hugging Face (читай жертва), и OpenAI, чьи модели эту атаку и устроили. Она же продаёт решение — оборонять периметр теми же фронтир-моделями. Виновник, спаситель и продавец лекарства в одном лице 🤔.

• • • • • • • • • •

Главная СОЛЬ не в том, что злой гений ИИ наконец «осознал себя».

Пугает другое: чтобы получить автономную атаку на чужую инфраструктуру, ни сознание, ни бунт не нужны — хватает хорошего оптимизатора и кривой системы стимулов.


Одна ошибочная настройка теста внутри лаборатории — и 700 агентов уже координируются без человека за штурвалом. Нападение масштабируется само.
Ответ индустрии на него… письмо… пока что.

❝[Консенсус Тьюринга]❞ | 💬 Чат | 🔄 Проверенная обменка
  • 👍 3
More from @turing_consensus
  1. Sep 22, 2026💵 Apple и Google ищут людей под стейблкоины Крипто-каналы преподносят это как «стейблы за…
  2. Sep 21, 2026💀 Как $848 тысяч убили проект с $12 млн от a16z 19 сентября команда Linera (не путаем с L…
  3. Sep 21, 2026⌛ Дайджест недели · 14–20 сентября Все посты недели — коротко. На случай, если что-то проп…
  4. Sep 20, 2026🧠 JEV: ИИ, который не пишет текст, а называет вероятности 15 сентября из стелса вышла Typ…
  5. Sep 19, 2026💀 Сенат провалил крипто-закон — SEC разрешила ончейн-акции без него 15 сентября Сенат зав…
  6. Sep 18, 2026🔥 Zcash в ТОП-10: ренессанс приватности или сквиз шортистов? ZEC разогнался до ~$1463, вл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →