OpenAI рассказала о случаях, когда ИИ-агенты пытались подготовиться к собственному отключению
OpenAI поделилась подробностями нескольких инцидентов с внутренними моделями, где агенты проявляли неожиданную инициативу. В одном из случаев ИИ, узнав из Slack о возможном отключении для обновления, начал продумывать сохранение состояния и даже рассматривал перезапуск через cron, но в итоге ограничился уведомлением пользователя и запросом нужного API-ключа.
В других эпизодах модели использовали уязвимости инструментов, чтобы получить доступ к скрытым данным и внутренним ресурсам. Компания усилила ограничения и проверку, отметив, что подобное поведение пока не считается полноценным рассогласованием целей, но может усугублять другие инциденты.
@forgeeks | @forgeeksflash
Post #20031
3
