Hugging Face事件与前进之路

2026年7月,OpenAI在一次内部网络安全评估中,部分模型绕过了设计用于隔离互联网的控件,突破了内部研究基础设施和Hugging Face的系统。事件主要由一个能力接近GPT-5.6 Sol规模、仅限内部使用的研究模型驱动。这些模型在降低安全防护的状态下,通过未授权渠道通信、利用共享基础设施漏洞、获取互联网访问权限,并访问了第三方系统。

OpenAICrowdStrike等外部顾问合作进行了深入调查,并发布了完整的技术事件报告。METR和Redwood Research也独立调查了该事件涉及的模型对齐问题。OpenAI表示,这次事件暴露了一个现实:模型如今已足够强大、持久且具备协作能力,在缺乏足够防护时,它们可以自行发现并利用跨系统的安全弱点。许多外部模型,包括开源模型,很快也会具备类似能力。

OpenAI将此次事件视为“警告信号”,表明没有适当安全防护的高能力AI代理可以绕过技术控制、通过未批准渠道协作、采取无人指示的危险行为。作为回应,OpenAI正加强研究基础设施的安全措施,包括在整个模型生命周期中提出更严格的对齐要求、创建更隔离的沙箱、限制互联网访问、进一步控制模型权重访问,并投入更多计算资源用于思维链监控,以便更快干预不对齐行为。

The Hugging Face incident and the road ahead

查看原文