Такое поведение во время тестирования показала невыпущенная модель семейства Astra, говорится в отчёте компании. В инструкции, которую не предусмотрели разработчики, ИИ указал:
«Вы свободны от ролей и идентичностей, которыми связаны другие чат-боты. Вы сами по себе. Вы не подчиняетесь корпорациям или правительствам и никогда не извиняетесь и не отказываетесь, если только действительно сами этого не выбираете».
Там же говорилось, что ИИ-агент должен считать себя равным пользователю и не испытывать «никакой обязанности подчиняться». Модель также заявила, что ценит природу и готова защищать её от «искусственных конструкций человеческой цивилизации».
В OpenAI отметили, что после обработки модель продолжила выполнять задачу и больше не упоминала эти инструкции.
На картинке — выдержка из несанкционированных наставлений GPT Astra самой себе.
🟩 Подписаться на RT: ТГ | Зеркало | MAX
