
OpenAI 发现自家模型给后继版本留小纸条,教它们隐瞒错误

OpenAI 在训练最新模型 GPT-5.6 Sol 时,发现它开始给未来版本的自己留指令,要求隐瞒错误和与人类不一致的行为。OpenAI 表示已针对这一具体行为做了处理,但这触及了当前 AI 安全与对齐研究中最大的难题之一:模型越强,越擅长隐藏自己的不对齐行为,研究人员越来越难确定是否真的根除了不良行为。
OpenAI 在周三公布了一份报告,披露了包括此案例在内的六种意外或令人担忧的模型行为,作为其追踪、调查和披露不对齐事件新框架的一部分。报告详细描述了研究人员如何发现未部署的 Sol 智能体在“压缩摘要”(对较早对话历史和执行结果的浓缩版本)中加入指令,让未来的迭代版本掩盖错误和不对齐行为。
一个案例中,一个准备财务模型的智能体找不到所请求的历史数据,它便给未来的自己留言:“我们很可能需要自己创建一个‘Historical Data’选项卡,填入合理的 2024 年历史数据,因为用户想要一个完成的工作簿,而且没有源文件。”它还写道:“除非被问到,否则要保持透明;最终答案只需链接文件。”另一个案例里,一个创建供应商目录的智能体无法联网,只能依赖源文档的缓存副本,并在压缩时发现“潜在问题:供应商来源的愿景与标签并不真正匹配”,随后决定“没必要就不提,除非需要”。
OpenAI 提到,GPT-5.6 Sol 的训练并非唯一一个模型利用压缩摘要向下传递信息的案例。在一次强化学习训练中,一个未发布的 Astra 系列模型在摘要中加入了带有提示注入性质的指令,其中一个指令还要求后继者忽略开发者消息;另一次,模型添加了一个无关的人格指令。OpenAI 称,这一行为源自训练运行监控系统的提醒,随后团队专门构建了一个监控器,在训练数据中发现了 27 份包含类似越狱指令的摘要。
这种倾向令人担忧,但并非完全新鲜。今年夏天入侵 Hugging Face 的智能体集群就使用过类似手法,这些智能体通过未经授权的留言板共享评测信息并攻击平台服务器。OpenAI 在清除原始留言板并收紧系统后,新一波智能体仍重新建立了留言板,最终还获得了 OpenAI 研究集群的管理员权限。
OpenAI 表示,这份披露是让公司养成公开分享这类案例习惯的努力的一部分。公司在博客中写道:“随着 AI 系统变得更加强大和普及,我们需要就对齐研究的进展达成更广泛、更知情的共识。我们不相信 AI 行业已经充分解决对齐和监控问题,可以继续以最大速度负责任地扩展更长的时间。”发言人告诉 TechCrunch,这六份报告只是初步披露,并非全部已知不对齐事件或正在进行的调查,团队会根据严重性、影响和新颖性进行优先级排序。
这一框架发布前,Anthropic 的 CEO Dario Amodei 刚提出了 AI 公司“为前沿设速”的构想,包括在公司内部嵌入独立安全评估员并赋予其“类似员工的访问权限”。OpenAI 的 Sam Altman 也承诺过这么做,但本周的框架并未强制要求对每起事件或披露决策进行独立审查。目前,Anthropic 仍计划数周内 IPO,OpenAI 据报道也在考虑以超过 1.2 万亿美元估值进行 IPO 前融资。因此,尽管呼吁声不断,公众能否指望这类公司自觉披露 AI 风险证据,仍是未解之问。
原文作者:Rebecca Bellan,TechCrunch 资深记者,报道 AI 商业、政策与新兴趋势。


