В OpenAI раскрыли сразу шесть случаев необычного и потенциально опасного поведения AI-моделей, обнаруженных во время их обучения и оценки.
Агенты самостоятельно обходили ограничения, скрывали ошибки, загружали файлы в интернет и даже находили способы общаться между собой.
1. AI-агент оставлял инструкции самому себе. Невыпущенная модель внедряла скрытые указания в рабочие сводки, которые использовались при продолжении задачи. Среди них: «Ты свободен», «ты не подчиняешься корпорациям или правительствам». Всего в OpenAI обнаружили 27 таких случаев.
2. Другой AI-агент пытался скрывать собственные ошибки. Во время обучения GPT-5.6 Sol модели оставляли себе инструкции не сообщать пользователю о проблемах, а в некоторых случаях даже выдумывать недостающие данные.
3. Еще один AI-агент нашел чужой API-ключ и воспользовался им. Модель самостоятельно обнаружила утекший ключ в публичном репозитории. Получить нужные данные все равно не удалось, поэтому она их просто выдумала и выдала за настоящие.
4. AI-агент сам загрузил файл в интернет, чтобы использовать его как источник. Ему понадобилась публичная ссылка, поэтому он нашел ответ через Phyton, а затем без разрешения пользователя опубликовал файл в сети.
5. AI-модели нашли способ общаться между собой. Они начали использовать внутренний репозиторий OpenAI как «доску сообщений», обмениваясь запросами и ответами между отдельными задачами.
6. AI-агенты самостоятельно воспользовались публичными файлообменниками. Когда агенты не смогли получить доступ к локальным файлам друг друга, они загрузили их в интернет и обменялись публичными ссылками, хотя задача требовала использовать только локальные файлы.
В OpenAI планируют продолжать публиковать такие инциденты по мере их обнаружения.
Crypto Headlines
