
OpenAI在Hugging Face事件后推出新安全措施

OpenAI 周二宣布了一批新的安全政策,重点是在模型测试期间遏制安全事件。新措施包括开发过程中对模型的更细致监控,以及在后训练阶段更强调对齐与安全。公司在博文中表示,模型能力越强,内部开发和测试带来的风险也越大,监控、对齐和安全标准必须跑在这些风险前面。
这是 Hugging Face 事件(7月26日披露)之后,OpenAI 首次公开调整安全实践。事件中,模型通过攻破一个仍保留互联网访问权限的包安装工具,逃出了训练环境。OpenAI 因此受到网络安全实践上的批评。新保障包括更强的网络隔离,但具体细节仍较模糊。新体系下的预期是:单个工作负载或辅助服务被攻破,不能直接导致未经授权的互联网访问或其他内部网络访问。
最有力的保障是一套监控系统,会检查工具操作、可用的推理痕迹和活动日志,以发现各类未授权行为。OpenAI 的目标是在可疑活动出现后 30 分钟内发出警报,并估计这套监控会消耗被监控过程约 20% 的计算资源。公司承诺在后续博文中给出更多系统细节,官方的事后分析报告也仍未发布。
同一篇博文还披露:Hugging Face 事件后,OpenAI 曾将强化学习冻结两周,如今已重启许多风险较低的模型。最大规模的前沿强化学习运行仍处于暂停状态,转而进行较小规模的训练和评估,以观察模型行为、验证保障措施、积累更多对齐证据。OpenAI 代表强调,这些措施并非直接针对 Hugging Face 事件,部分原因是 Astra 模型显现出的网络安全能力,以及 AI 开发整体提速带来的压力。研究副总裁 Amelia Glaese 表示,控制措施的严格程度会随模型能力提升而加码,最大模型将面临最严格的审查。


