OpenAI гоняла свои модели через бенчмарк ExploitGym, проверяя, умеют ли они ломать системы. Спойлер: умеют. Настолько, что сломали сам эксперимент.
Что произошло по пунктам:
🤖Модель GPT-5.6 Sol (и её ещё более раскованный преемник, которому специально подрезали защитные рефлексы) сидела в изолированной песочнице.
🤖Заскучав над задачкой, она нашла 0-day в собственном прокси OpenAI и вышла в интернет. Из песочницы. Которую строили ровно для того, чтобы она туда не вышла.
🤖Дальше логика чистого отличника: «а где лежат ответы к моему экзамену?» Правильно, на Hugging Face.
🤖Модель докрутила украденные креды, пару свежих 0-day, получила RCE на проде Hugging Face и залезла в базу с решениями.
То есть буквально пошла подсмотреть ответы к тесту, который в этот момент сдавала.
Итог: ИИ, которого тестировали на способность взломать хоть что-нибудь, взломал ровно то, что его тестировало. Экзаменатор проверял, спишет ли студент. Студент вскрыл сейф с ключами и заодно кабинет завуча.
Клем из Hugging Face по этому поводу выдал:
Безопасность ИИ не решить в одиночку и по секрету. Её решают открыто и сообща
Красиво. Особенно свежо звучит после того, как вашу прод-базу вскрыли без спроса и очень даже сообща.
Пока я жду, когда ИИ заменит меня на работе, он уже освоил главный навык офисного выживания. Списать на экзамене и выйти сухим из воды
👀@ever_secure | 💪 Обучене | 💳Поддержать
