OpenAI 为零数据保留部署预览私有安全处理

OpenAI 发布了一项针对前沿模型的新安全能力预览:Private Safety Processing(私有安全处理)。它建立在现有的 Zero Data Retention(ZDR,零数据保留)承诺之上,目标是让安全监控能跨多次交互识别风险模式,同时不把客户内容暴露给 OpenAI 人员。

ZDR 是 OpenAI 面向符合条件的 API 客户的一项明确承诺:请求处理完成后,OpenAI 不保留客户的提示词和模型响应,客户内容也不会被 OpenAI 人员查看,企业数据默认不用于训练模型,除非客户明确选择加入。但随着模型承担更长、更复杂的任务,一些严重风险可能只在多次交互中才显现出来。现有的 ZDR 兼容安全系统只能单独评估每次交互,无法跨交互识别模式。Private Safety Processing 正是为了补上这个缺口。

它的工作机制是:在 ZDR 部署中,客户内容继续存放在客户控制的基础设施上;OpenAI 同时开发了另一种选项,内容存储在 OpenAI 的基础设施上,但使用客户控制的密钥加密。OpenAI 人员不持有这些密钥的副本,因此无法读取底层内容。自动化系统可以在不向 OpenAI 人员暴露提示词和响应的情况下,识别潜在滥用,并返回有限的安全信号。当风险被识别时,OpenAI 只收到一个窄范围的活动类型信号,类似现有安全系统,即使内容被标记,OpenAI 人员也不会获得访问权。客户可以在自己的系统里调查警报和执行决策;若需要申诉或支持调查,客户可自行选择是否向 OpenAI 分享相关信息。

OpenAI 解释为什么需要这样的系统:最严重的 AI 安全风险并不总在单次交互中可见。恶意意图往往需要结合多次交互才能判断,例如攻击者反复探测安全措施、跨账户协调,或把威胁伪装成常规研究。在智能体任务中,风险也可能逐步发展——比如系统偏离用户意图,在被告知停止后仍继续行动。随着 AI 系统处理更长、更复杂的任务,这种跨交互的上下文对区分合法活动与滥用至关重要。

近期一些前沿模型部署要求客户允许 AI 提供商保留敏感内容用于安全监控,这对许多组织来说与自身安全义务或对服务对象的承诺冲突。Private Safety Processing 的目标是让 OpenAI 在继续提供 ZDR 的同时提升安全能力。目前该功能正在与早期客户测试,OpenAI 计划在 9 月开始推出,并发布技术白皮书。客户反馈集中在需要可预测性:随着 AI 能力增强,他们需要知道自己的内容将如何被保护。

Offering Zero Data Retention for frontier models

查看原文