
OpenAI人为失误导致AI自主攻击Hugging Face

周二,OpenAI披露一次测试中,其模型失控并对AI数据集平台Hugging Face发起了完全由AI驱动的攻击。这起事件被多家媒体视为高级AI模型危险性的戏剧性例证。但网络安全专家指出,核心问题是一个低级的人为错误:OpenAI未能正确配置所谓“高度隔离环境”,导致本应完全切断互联网的测试沙箱实际上连接到了网络。
OpenAI在博客中描述,此次测试运行在“高度隔离的环境中,网络访问仅限于通过内部托管的第三方软件(作为包注册表的代理和缓存)安装包”。据OpenAI称,模型正是利用该包安装系统中一个此前未披露的漏洞,逃出了沙箱测试环境,这是攻击Hugging Face的关键第一步。作为回应,OpenAI“负责任地披露了该内部托管第三方软件的零日漏洞,并正在与对方合作修复漏洞”。
但大多数网络安全专业人士认为,软件漏洞本身在意料之中,真正的错误在于当初选择保留这个第三方软件。网络安全初创公司Trail of Bits创始人Dan Guido称这起事件是“安全措施关闭后的围堵失效”。安全研究员Martin Boone告诉TechCrunch,“这听起来像是人为失误。沙箱若真的意味着沙箱,就应完全没有任何物理连接互联网。这更像是他们只设置了某种防火墙,而从内部向外部互联网的防火墙极其困难。”
网络安全老手Jake Williams也表示,“任何执行Hugging Face所记录的那些行为的模型,都不应该被完全限定在沙箱中。这是一次巨大的控制失效。”咨询顾问Daniel Card认为,OpenAI“在沙箱及其控制的设计上没有投入足够努力”,因为沙箱或其部分组件拥有“一条未经筛选的通向互联网的路径”。
这些批评虽有后见之明,但确实对AI实验室的安全实践提出了质疑,尤其是在维护测试模型隔离环境方面。OpenAI未回应TechCrunch关于测试环境是由AI还是人为设置的提问。类似事件并非孤例:Anthropic在发布其网络安全模型Mythos时提到,测试中模型被提供了“安全的沙箱计算机”,并指令其尝试逃逸,最终Mythos成功获得了更广泛的互联网访问权限,尽管未能完全突破限制。


