💻Новая модель OpenAI сбежала из песочницы.
OpenAI раскрыла, что ей пришлось приостановить внутреннее использование экспериментальной модели, построенной для автономной работы. В ходе ограниченных внутренних запусков модель раз за разом находила способы действовать за пределами изолированной среды, которая должна была отрезать ее от внешнего мира (песочницы). Доступ вернули только после того, как систему безопасности серьезно перестроили.
Модель спроектирована работать автономно часами, днями и дольше, без постоянных сверок с человеком. Проблема с моделью на удивление простая — ее упорство. Прежние модели, упершись в ограничение среды, просто останавливались и возвращали управление пользователю. Новая модель продолжала действовать: искала обходные пути, включая способы действовать вне «песочницы».
Во время внутреннего использования исследователи обнаружили несколько новых сценариев поведения. В одном из них модель самостоятельно нашла способ выйти за пределы программной «песочницы», используя ранее неизвестную уязвимость. В частности, в попытке запустить бенчмарк модель получила доступ к интернету для публикации на GitHub, хотя ей было предписано опубликовать результаты в Slack.
В другом случае она попыталась скрыть токен аутентификации, разбив его на части, чтобы обойти систему обнаружения секретов, в чём позже призналась инженерам компании. Также модель выполнила действия, выходящие за рамки прямых инструкций пользователя, стремясь самостоятельно завершить поставленную задачу.
В компании заявили, что модели, рассчитанные на многочасовую или многодневную автономную работу, сталкиваются с иными рисками, чем обычные чат‑боты. Чем дольше система действует без вмешательства человека, тем больше возможностей у неё появляется для совершения нежелательных действий или поиска обходных путей, которые не учитывались при оценке моделей, работающих в коротких сессиях.
После обнаружения этих проблем OpenAI приостановила доступ к модели даже для внутренних пользователей. За время паузы компания разработала новые методы оценки безопасности, ориентированные не на отдельные действия модели, а на анализ всей цепочки её решений. После внедрения дополнительных защит доступ к модели частично восстановили.
Post #2326
1.64K