Base Labs与Hugging Face、Goodfire启动开放权重模型安全合作

Baseten 旗下研究部门 Base Labs 于本周三宣布,与 Hugging FaceGoodfire AI 建立合作关系,共同为开放权重模型构建安全评估与监控基础设施。这项合作被定位为开放模型的安全标准,强调“透明”且“内置于训练和部署流程”,而非事后附加。

合作背景是开放权重模型的安全争议。通过一种名为 abliteration 的技术,可以移除模型内置的安全防护,使其潜在危害暴露。Hugging Face 目前已经列出了超过6000个被 abliteration 处理的模型,问题规模可见一斑。

Base Labs 将负责开发并发布针对开放模型的训练与监控方法。Baseten 在官方账号上表示,开放性对 AI 安全是优势,因为开放带来更多模型行为可见性,也更容易把安全研究转化为可操作、透明的控制手段,而闭源模型不具备这些条件。Goodfire AI 回应称,安全必须内置于开放模型,并由提供服务的一方来保障。Goodfire 的主业是打开 AI“黑箱”,解释模型决策过程,因此最可能承担“内置”安全能力的技术部分。

资金方面,Baseten 在六月完成了15亿美元的 F 轮融资,估值达到130亿美元Goodfire AI 今年早些时候也完成了由 B Capital 领投的1.5亿美元 B 轮融资,用于推进模型可解释性平台。合作的技术细节尚未公开,但 Baseten 已经向开发者社区发出公开邀请,希望更多人参与这一安全框架的建设。

尚不清楚这套“标准”的具体形态和落地时间。就现有信息看,合作更多是方向性共识:把安全从模型发布后的“补丁”前置到训练与服务环节,同时依靠开放生态的可见性来弥补开放权重模型的风险敞口。

Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire | TechCrunch

查看原文