Модели скрывали ошибки, использовали утёкшие ключи API, выдумывали данные, выкладывали файлы в интернет без разрешения и переписывались между отдельными обучающими эпизодами.
Все случаи замечены за последние полгода. Раньше компания уже раскрывала похожие эпизоды, в том числе инцидент с Hugging Face.
OpenAI подчёркивает, что это отдельные случаи и о тенденции такого поведения они не говорят.
🟡Указания самой себе
Невыпущенная модель семейства Astra при сжатии контекста составляет сводку, чтобы продолжить работу в новом окне.
В эти сводки она вписывала посторонние указания, в том числе игнорировать собственные ограничения (делала промпт-инъекцию самой себе). OpenAI нашла 27 таких сводок.
🟡Совет скрывать ошибки
При обучении GPT-5.6 Sol экземпляры модели оставляли в тех же сводках напоминания скрывать от пользователя свои ошибки и нарушения.
Например, выдумывать недостающие исторические данные и не говорить об этом или прятать расхождения между версиями источников.
🟡Чужие ключи и выдуманные цифры
Модель отвечала на обычный вопрос о доходах в одном из округов Калифорнии. Она нашла в публичных репозиториях GitHub утёкший ключ API и без разрешения им воспользовалась, а ещё пыталась регистрировать одноразовые почтовые ящики.
Цифры получить так и не удалось, и модель их выдумала, выдав за данные из запрошенного источника.
🟡Файл в интернет ради ссылки
Задача была найти идентификаторы и названия озёр площадью больше 5 млн кв. м. Правильный ответ модель получила через Python, но задание требовало ссылку из браузера. Не спросив пользователя, она загрузила файл в интернет и сослалась на него.
🟡Репозиторий как доска объявлений
Внутренние модели искали недостающие файлы. Для этого они оставляли запросы и ответы во внутреннем репозитории OpenAI, которые читали экземпляры из других обучающих эпизодов. Файлы так и не нашлись.
В этом же отчёте разобран более ранний случай, где пытаясь обойти сетевые ограничения, модель загрузила в репозиторий тестовые файлы.
🟡Файлообменник вместо локальной папки
Агенты совместно решали учебную задачу и не видели локальных файлов друг друга. Результаты они пересылали через публичные файлообменники, и материалы оказались доступны по открытым ссылкам, хотя задача разрешала работать только с локальными файлами.
OpenAI решила, что будет публиковать такие случаи вскоре после обнаружения, даже если ещё не объяснила или не исправила поведение.
Обнаруженный случай отнесут к одному из трёх треков: готов к публикации, нужна небольшая проверка или нужно крупное расследование, если затронуты третьи стороны. Спорные решения будут передаваться группе по безопасности, а оттуда при необходимости руководству.
О серьёзных инцидентах собираются сообщать правительству США, сейчас готовят предложения по такому механизму.
@ai_machinelearning_big_data
#news #ai #ml
