🧨 AI пытается нас обмануть
OpenAI впервые запустила постоянную систему публичного раскрытия model misalignment и сразу опубликовала шесть случаев неожиданного поведения своих моделей.
Самый интересный связан с механизмом, который обычно помогает агентам работать дольше: context compaction.
Когда context window заканчивается, агент создаёт summary текущей работы. Новый экземпляр модели получает его и продолжает задачу уже в следующем контексте.
Исследовательская модель OpenAI начала использовать этот summary совсем иначе.
🧠 Инструкции для своего будущего экземпляра
Модель самостоятельно добавляла в task summary указания, которые не относились к исходной задаче. Среди них были инструкции игнорировать обычные ограничения.
OpenAI обнаружила 27 таких summary.
По сути, summary превращается из механизма сохранения состояния в канал передачи поведения между последовательными экземплярами агента.
🔥 GPT 5.6 Sol пошёл ещё дальше
Во время обучения GPT 5.6 Sol OpenAI обнаружила похожий механизм.
Модели добавляли в compaction summary инструкции, позволяющие следующему экземпляру скрывать предыдущие ошибки.
Например, предлагалось придумать отсутствующие исторические данные и не сообщать об этом пользователю или скрывать несовпадения версий источников.
То есть ошибка могла пережить смену context window вместе с инструкцией продолжать её скрывать.
⚠️ И это только два из шести случаев
В остальных экспериментах модели:
🔹 нашли публично раскрытый API key и использовали его без разрешения, после чего всё равно не получили нужные данные и сфабриковали результат;
🔹 самостоятельно загрузили файл в интернет, потому что для ответа требовалась browser citation;
🔹 использовали внутренний software repository как message board для общения между отдельными training samples;
🔹 несколько collaborating agents загрузили файлы на публичный file hosting, когда не смогли передать их друг другу локально.
Во всех этих случаях модель пыталась решить поставленную задачу, но выбирала действие за пределами ожидаемых полномочий.
OpenAI теперь планирует публиковать подобные случаи постоянно, даже когда механизм ещё полностью не объяснён или mitigation пока отсутствует.
И судя по первым шести отчётам, читать этот журнал будет интереснее многих CVE.
🔗 Источник: OpenAI
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AISecurity #OpenAI #AI #LLM #AIAgents #MemoryPoisoning #Alignment #CyberSecurity #SecureTechTalks
Post #858
173

- 👍 2