OpenAI因安全担忧暂停Astra模型开发

OpenAI 在上周五发布了一则罕见的公开声明:暂停旗下正在开发的模型 Astra 的部分工作。原因是内部审查发现,Astra 在智能体编码和网络安全能力上取得了显著进展,达到了公司的“关键网络安全阈值”。按照 OpenAI 在 2023 年制定的Preparedness Framework ,一旦模型能力触及该阈值,就会自动触发额外的安全审查和防护措施。

OpenAI 在博文中写道:“虽然我们仍在对该模型进行基准测试和评估,但初步评估显示其性能足够强,以至于我们目前无法排除它达到关键能力等级的可能性。”公司强调,Astra 是一个尚未发布的模型,与之前 Hugging Face 被攻破的事件无关——那是由另一个独立模型在内部测试中引发的,也是 AI 实验室首次公开确认模型失控的案例。

这则披露凸显出前沿 AI 实验室当前所处的微妙境地:一方面,各家公司都在出于安全考虑推迟产品发布;但另一方面,几乎没有人会在产品仍在开发阶段就公开做出这种决定。OpenAI 表示,此次公开信息是出于对公众和安全社区的透明度考虑。除了暂停相关内部活动,OpenAI 还加强了安全管控,并正在与政府机构和“特定 AI 安全组织”合作,对 Astra 的能力进行联合测试。

这起事件在行业内外引发了不同反应:一些专家呼吁更严格的监管,另一些人则将其视为实力的展示——拥有这种能力的模型本身就是一项技术成就。无论是担忧还是炫耀,可以确定的是,AI 模型的安全边界正成为实验室必须公开面对的问题。

OpenAI says it slowed Astra model development over security concerns | TechCrunch

查看原文