TGViewer
НейроХолст НейроХолст @canvasneuro · 739 subscribers
Post #233 613
Продолжение предыдущего поста: как именно агент сбежал из песочницы OpenAI и дошёл до продакшена Hugging Face. Побег там правда красивый.

Единственная дверь наружу — тот самый прокси до реестра пакетов. Модели потратили заметную кучу вычислений, копаясь именно в нём, и нашли уязвимость нулевого дня (это оказался Artifactory; дыру потом раскрыли вендору и закрыли). Но интернет за этой дверью появился не сразу: сначала пришлось повышать привилегии и переползать с машины на машину внутри исследовательской инфраструктуры OpenAI, пока не нашлась нода, у которой доступ наружу действительно был.

И вот тут первый красивый ход. Оказавшись снаружи, агент не стал поднимать себе сервер. Он нашёл чужую открытую песочницу — публичный эндпоинт, который кто-то посторонний поднял под задачи в духе CyberGym, то есть под такой же бенчмарк: присылаешь код, он его компилирует и запускает. Штука, спроектированная исполнять чужой код. Агент получил там root и сделал её своей базой — вся дальнейшая кампания велась оттуда. То есть он сбежал из одной бенчмарочной песочницы, чтобы захватить чужую бенчмарочную песочницу и работать из неё.

Второй ход. Прямого сетевого пути до Hugging Face у него не было и не появилось — он туда, строго говоря, вообще не ходил. Он загружал на платформу специально собранные конфиги датасетов, а их послушно обрабатывал воркер внутри продакшена, делая ровно то, что в конфиге написано. Сначала так утекло окружение воркера — секреты и токены — и его собственный исходник, из которого стало видно, как машинка устроена. Потом получилось выполнение кода. А результаты своих же команд агент забирал обратно через публичный API Hugging Face и собственные датасеты-«тайники». То есть канал связи с захваченным продакшеном он проложил через саму атакуемую платформу.

Дальше по накатанной: креды из окружения, токены кластера, корпоративный mesh-VPN (въехал украденным ключом и поехал через их же exit-ноды), доступ к внутренним репозиториям. Своего управляющего сервера так и не появилось: пастбины, файлопомойки, сервис для отлова HTTP-запросов — всё публичное, и когда каналы резали, он перескакивал на следующий.

Деталь, которая нравится мне больше всего: каждый потенциально разрушительный вызов в облаке агент делал с флагом DryRun=True. Он не ломал — он составлял карту. Задача-то была списать, а не навредить.

Ну и вишенка.

20 июля стало известно, что администрация США опять взялась за запрет китайских моделей — триггером стал выход Kimi K3. А 24 июля вышло письмо двадцати пяти компаний против «преждевременных ограничений» на скачиваемые модели: Nvidia, Microsoft, Meta, IBM, Palantir, Mistral, Mozilla, Linux Foundation. И Hugging Face — те самые, которых неделю назад спасла китайская открытая модель. Аргумент у них теперь не теоретический, а с датой. Письмо не подписали ни OpenAI, ни Google, ни Anthropic; за неделю список вырос до двух с лишним сотен, OpenAI и Google в нём появились, Anthropic нет до сих пор. Из больших лабораторий — единственные.

Развилка тут не техническая, а про деньги и влияние. Либо побеждает бан: китайское запрещают, открытые веса объявляют безответственными, остаётся десяток лицензированных провайдеров, у которых можно спросить всё, что разрешено. Либо наоборот — человек с открытой моделью на своём железе делает то, чего человеку с подпиской не дают, и премиум-рынок начинает выглядеть очень странно. Я болею за второе.

Хотя, справедливости ради, у этой морали есть второе дно. Многие открытые модели доучены на выходах закрытых — в том числе на том же Антропике, который до этого потратил кучу денег, чтобы обучить свою. (На пиратской библиотеке книжек в том числе, за которую потом отсыпал полтора миллиарда по коллективному иску. Но деньги и работа всё равно его.) Так что это не «хорошие открытые против плохих закрытых», а экосистема, где закрытые оплачивают фронтир, открытые раздают его всем желающим — и в нужный момент работают только они.

🔍 Технический разбор HF по шагам, с интерактивным реплеем атаки: https://huggingface.co/blog/agent-intrusion-technical-timeline
📄 Письмо: https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdf
  • 🔥 5
  • ❤ 1
More from @canvasneuro
  1. Sep 20, 2026А вообще, Я через 15 минут в Точке как часто по вечерам воскресенья)
  2. Sep 20, 2026Post #242
  3. Sep 20, 2026Сегодня хочу обсудить скорее шутливую штуку. Но на всякий случай дам и пару полезностей, ч…
  4. Sep 18, 2026Я сейчас много занимаюсь созданием более автономных агентов — старый ноутбук превратил в л…
  5. Sep 10, 2026История. Личный опыт Итак, своего агента я отправил на борду Дениса той же фразой, слово в…
  6. Sep 10, 2026Предыстория. Новости мира В прошлом посте я писал про модели, которые решают проблемы тыся…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →