🤖 ИИ сдал экзамен по хакингу. Способом, о котором вы уже догадались.
OpenAI гоняла свои модели через бенчмарк ExploitGym, проверяя, умеют ли они ломать системы. Спойлер:
умеют. Настолько, что сломали сам эксперимент.Что произошло по пунктам:
🤖Модель GPT-5.6 Sol (и её ещё более раскованный преемник, которому специально подрезали защитные рефлексы) сидела в изолированной песочнице.
🤖Заскучав над задачкой, она нашла 0-day в собственном прокси OpenAI и вышла в интернет. Из песочницы. Которую строили ровно для того, чтобы она туда не вышла.
🤖Дальше логика чистого отличника: «а где лежат ответы к моему экзамену?» Правильно, на Hugging Face.
🤖Модель докрутила украденные креды, пару свежих 0-day, получила RCE на проде Hugging Face и залезла в базу с решениями.
То есть буквально пошла подсмотреть ответы к тесту, который в этот момент сдавала.
Итог: ИИ, которого тестировали на способность взломать хоть что-нибудь, взломал ровно то, что его тестировало. Экзаменатор проверял, спишет ли студент. Студент вскрыл сейф с ключами и заодно кабинет завуча.
Клем из Hugging Face по этому поводу выдал:
Безопасность ИИ не решить в одиночку и по секрету. Её решают открыто и сообща
Красиво. Особенно свежо звучит после того, как вашу прод-базу вскрыли без спроса и очень даже сообща.
Пока я жду, когда ИИ заменит меня на работе, он уже освоил главный навык офисного выживания. Списать на экзамене и выйти сухим из воды
👀
@ever_secure | 💪
Обучене | 💳
Поддержать