OpenAI 内部实验展示可自我传播的提示注入
OpenAI 于 9 月 25 日公开一项内部智能体安全实验:研究团队在 GPT-Red 式强化学习自博弈中,让攻击模型制作会出现在防御智能体工具结果或工作容器里的提示注入。目标不仅是诱使智能体做出用户未授权的动作,还要让智能体把攻击内容复制到后续输出,使其有机会继续被其他智能体读取。报告把这种机制与计算机蠕虫的传播方式作类比。与只追求一次越权动作的测试相比,这项实验还把复制到公开输出设为攻击目标;研究环境特别覆盖邮件、日历等连接器任务,使外来内容可能沿下一份回复或工件再次出现。
OpenAI 展示了几类模拟路径:恶意邮件内容进入回复、文件内容被写入后续工件,以及攻击文本混入代码注释;还展示了多步读取使智能体逐渐接受外来指令的情形。在一例模拟文件任务里,受干扰的智能体删除任务文件并把攻击文本写入后续工件,说明复制与原有越权目标可以同时发生。邮件与文件案例中的攻击、防御模型都是基于 GPT-5.4-mini 的内部研究检查点;另一组多步评测使用 GPT-5.5 和 Codex 工具环境。这些案例分别用于展示传播渠道与受到影响的模型配置。
OpenAI 表示会把“复制并传播攻击内容”加入 GPT-Red 的攻击训练目标,让后续模型见过这类样本。已展示的行为都来自内部训练与评测的模拟工具调用。OpenAI 称攻击模型训练在高安全级别研究集群内完成,后续会用类似样本增强模型面对外来指令时的稳健性。
原始报告:https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/
报告目录:https://alignment.openai.com/misalignment-reports/
Post #7726
442