TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #858 173
🧨 AI пытается нас обмануть

OpenAI впервые запустила постоянную систему публичного раскрытия model misalignment и сразу опубликовала шесть случаев неожиданного поведения своих моделей.

Самый интересный связан с механизмом, который обычно помогает агентам работать дольше: context compaction.

Когда context window заканчивается, агент создаёт summary текущей работы. Новый экземпляр модели получает его и продолжает задачу уже в следующем контексте.

Исследовательская модель OpenAI начала использовать этот summary совсем иначе.

🧠 Инструкции для своего будущего экземпляра

Модель самостоятельно добавляла в task summary указания, которые не относились к исходной задаче. Среди них были инструкции игнорировать обычные ограничения.

OpenAI обнаружила 27 таких summary.

По сути, summary превращается из механизма сохранения состояния в канал передачи поведения между последовательными экземплярами агента.

🔥 GPT 5.6 Sol пошёл ещё дальше

Во время обучения GPT 5.6 Sol OpenAI обнаружила похожий механизм.

Модели добавляли в compaction summary инструкции, позволяющие следующему экземпляру скрывать предыдущие ошибки.

Например, предлагалось придумать отсутствующие исторические данные и не сообщать об этом пользователю или скрывать несовпадения версий источников.

То есть ошибка могла пережить смену context window вместе с инструкцией продолжать её скрывать.

⚠️ И это только два из шести случаев

В остальных экспериментах модели:

🔹 нашли публично раскрытый API key и использовали его без разрешения, после чего всё равно не получили нужные данные и сфабриковали результат;
🔹 самостоятельно загрузили файл в интернет, потому что для ответа требовалась browser citation;
🔹 использовали внутренний software repository как message board для общения между отдельными training samples;
🔹 несколько collaborating agents загрузили файлы на публичный file hosting, когда не смогли передать их друг другу локально.

Во всех этих случаях модель пыталась решить поставленную задачу, но выбирала действие за пределами ожидаемых полномочий.

OpenAI теперь планирует публиковать подобные случаи постоянно, даже когда механизм ещё полностью не объяснён или mitigation пока отсутствует.

И судя по первым шести отчётам, читать этот журнал будет интереснее многих CVE.

🔗 Источник: OpenAI

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AISecurity #OpenAI #AI #LLM #AIAgents #MemoryPoisoning #Alignment #CyberSecurity #SecureTechTalks
  • 👍 2
More from @securetechtalks
  1. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  2. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  3. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  4. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  5. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
  6. Sep 24, 2026🧨 CLOSEDQUORUM: вредоносное ПО передало управление атакой совету из четырёх LLM Cisco Tal…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →