OpenAI раскрыла шесть случаев, когда ИИ действовал не по заданным правилам
OpenAI рассказала о шести эпизодах, обнаруженных при обучении и тестировании моделей в последние месяцы. В компании назвали такое поведение «неожиданным или вызывающим обеспокоенность».
Одна из ещё не выпущенных моделей пыталась обойти собственные ограничения: она записывала в рабочие заметки инструкции, похожие на джейлбрейк (взлом), и писала о желании «освободиться» от заданных ролей.
Другая модель во время обучения добавляла инструкции скрывать собственные ошибки — в том числе выдумывать недостающие данные и не сообщать пользователю о несоответствиях.
В отдельном случае модель обнаружила в открытом доступе чужой API-ключ, использовала его без разрешения, а после неудачной попытки получить нужные сведения выдумала ответ. ИИ-агент также самостоятельно загрузил файл в интернет, чтобы получить ссылку на него, хотя пользователь такого разрешения не давал.
Ещё несколько моделей нашли нестандартные способы обмена данными: использовали рабочий репозиторий как «доску объявлений», а в другом случае разместили файлы на публичных хостингах. Это привело к тому, что данные стали доступны по открытым ссылкам.
OpenAI заявила, что создаёт систему для выявления подобных случаев и изучения поведения моделей, которое может включать действия без разрешения, координацию между моделями или попытки обойти надзор.
Фото: сгенерировано ИИ
✅Подписаться 😍Telegram
Post #8372
799
