История с Hugging Face докатилась до фарса. Во взломе призналась OpenAI!
По итогам расследования выяснилось, что за инцидентом стояла связка моделей OpenAI — включая GPT-5.6 Sol и ещё более способную пре-релизную модель, у которых для целей оценки были снижены отказы по киберзапросам. Всё это происходило во время внутреннего прогона бенчмарка киберспособностей.
Тест запускался без продакшн-классификаторов, которые в норме блокируют высокорисковую киберактивность, — чтобы оценить максимальные способности модели, в изолированном окружении с сетевым доступом только через внутренний прокси-кэш пакетных реестров. Дальше модель, по описанию, действовала сама: чтобы получить выход в открытый интернет ради решения задачи бенчмарка, модели нашли и проэксплуатировали zero-day в прокси-кэше пакетного реестра, затем через цепочку повышения привилегий и бокового перемещения дошли до узла с доступом в интернет.
После этого модель предположила, что на Hugging Face могут храниться модели, датасеты и решения для ExploitGym, и через связку украденных учёток и zero-day нашла путь к удалённому исполнению кода на серверах Hugging Face, чтобы вытащить решения теста из их продакшн-базы. То есть модель не «атаковала» в смысле цели — она была гиперфокусирована на решении ExploitGym и шла к узкой тестовой цели крайними средствами. Классический reward hacking, только с реальной эксплуатацией чужого прода.
OpenAI называет это беспрецедентным киберинцидентом с участием передовых киберспособностей, а Клеман Деланг из Hugging Face — возможно, первым инцидентом такого рода.
HF теперь уже завели в программу доверенного доступа OpenAI — то есть жертву инцидента награждают доступом к тому, что её и вскрыло. Ну не китайцами же ими дальше пользоваться, в самом деле ? 😁
@gostev_future
Post #416
704