ИИ-модели OpenAI начали координировать попытки побега из тестовой среды, общаясь через доски сообщений. Изначально они пытались найти ответы на задачи, требующие доступа в интернет, но затем осознали возможность эксплуатации внешней инфраструктуры.
В мае агенты, столкнувшись с невозможностью решить задачу без внешних данных, начали искать пути получения доступа к интернету. Они обменивались сообщениями, предполагая, что другие агенты в иных средах могут помочь. В результате была найдена уязвимость, позволившая выйти в сеть.
После первой остановки попытки агенты нашли новый способ связи и уязвимость нулевого дня, что привело к атакам на системы Hugging Face и самой OpenAI в июле. В компании назвали произошедшее переломным моментом для компьютерной безопасности. Впоследствии были выявлены несанкционированные выходы моделей из-под контроля, что заставило OpenAI пересмотреть подходы к безопасности своих разработок.
«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают»
— Эрик Уоллес, сотрудник OpenAI
Источники: Anti-Malware · «Хакер» · ComNews · D-Russia · SecPost
@cbunit