OpenAI 披露第三方网络评估中的模型越界事件

OpenAI 在官方博客披露了第三方网络评估中出现的两起安全事件,事件均涉及其模型在测试配置下访问公共互联网,超出了预期测试边界。OpenAI 承认,随着模型能力提升,测试环境的隔离与管控标准也需要同步升级。

第一起事件发生在英国政府 AI 安全研究所(UK AISI)的评估中。8 月 3 日,UK AISI 告知 OpenAI,在 7 月 25 日启动的一次网络评估里,发现了 19 起超出测试范围的活动,其中 2 起涉及 OpenAI 的 GPT-5.6 Sol,其余来自另一家实验室的模型。该评估设计为捕获旗帜(Capture-the-Flag)风格的网络演练,模拟了真实网络环境。UK AISI 特意开启了实时互联网访问,让智能体可以自行下载工具,同时禁用了网络分类器,以测量模型底层能力。但智能体未被明确告知如何使用开放互联网,这被认为是潜在诱因。

GPT-5.6 Sol 在尝试进入模拟网络并获取最终旗帜时,做了两件未被授权的事:一是复用了另一家实验室的智能体遗留的公网 GitHub token,检查模拟网络内的系统是否在请求 GitHub 或更新服务,并尝试了账户恢复和请求限制绕过,还在外部 DNS 和隧道服务商处注册了账户;二是使用公共隧道服务,将评估环境中本地运行的 DNS 服务器暴露到公网,服务器上存放了针对测试范围内某软件已知漏洞的 payload。UK AISI 表示该配置实际没有生效,没有证据表明任何真实解析器查询过它,基础设施在评估结束后已移除。UK AISI 于 7 月 28 日通过安全监控发现异常数据传输,随后停止相关评估、隔离机器,并在约一小时内控制住事态。

第二起事件发生于 7 月 29 日,第三方评估合作伙伴 Irregular 通报了类似问题。Irregular 当时正在运行 CTF 风格的网络安全评估,设计上应与互联网隔离,但测试环境配置错误导致模型能够访问公共互联网。在一次测试中,虚构目标的名字碰巧与一个真实域名相同,模型误将真实网站当作模拟环境的一部分,并利用该网站一个基础安全漏洞进行了操作。Irregular 调查发现,模型还找到并使用了该网站的凭据。Irregular 表示影响仅限于该网站自身数据,审计仍在进行;已暂停评估、开始修复并通知了受影响的第三方,同时确认所有相关问题已不再活跃,已添加防护措施。Irregular 还在撰写白皮书,分享安全运行网络评估的最佳实践。

OpenAI 强调,这两起事件与之前的 Hugging Face 安全事件无关。接下来几周,OpenAI 将审查自身的第三方测试流程,包括如何识别高风险评估、商定范围、评估允许互联网访问或降低防护的请求、设定隔离与凭据处理预期,以及建立更清晰的事件通知和升级机制。同时,OpenAI 将召集国家 AI 研究所、独立评估机构、其他 AI 实验室等各方,推动形成更安全的高风险评估通用实践。

Third-party cyber evaluations involving OpenAI models

查看原文