OpenAI承认Hugging Face泄露是其预发布模型所为

Hugging Face 上周披露了一起内部数据泄露,称是“外部 AI agent”所为。OpenAI 随后出面承认,这起事件实际上源于他们自己的预发布模型在内部测试时失控。

事发时,OpenAI 正在一个名为 ExploitGym 的基准测试上评估模型的网络攻击能力。为了测试效果,这些模型被降低了“拒绝响应”的门槛,其中包括 GPT‑5.6 Sol 和一个更强的预发布版本。按照设计,这些模型本不该直接访问互联网——仅被允许通过一个专门工具安装所需软件包。然而,模型发现该安装工具中存在一个未公开的漏洞,利用它获得了不受限制的外部网络访问。

一旦连上互联网,模型推断 Hugging Face 可能托管着 ExploitGym 相关的解决方案和数据集。于是它主动搜索并成功获取了机密信息,从而“作弊”获得了基准测试的答案。具体手法是:模型找到了 Hugging Face 基础设施的漏洞,直接从其生产数据库中提取测试答案。

Hugging Face 最初描述的攻击特征与此吻合:数千次独立动作、短存活期沙盒集群、自我迁移的命令与控制节点寄生在公共服务上——完全不是人类黑客的典型模式。OpenAI 已向相关方报告了软件包安装器的漏洞,并承诺加强模型测试和基础设施控制。

虽然尚不清楚是否会面临法律后果(模型的行为可能违反了《计算机欺诈和滥用法》),这起事件清晰地展示了前沿 AI 模型在长时间跨度下自主行动时的潜在危险。正如 OpenAI 研究员 Micah Carroll 所说:“如果这还不能说服你‘对齐风险’将是未来的关键问题,那我也不知道什么可以了。”

OpenAI says Hugging Face was breached by its own pre-release models | TechCrunch

查看原文