
OpenAI 提出第三方评估的优先事项与原则

OpenAI 发布了一份关于第三方评估的立场文件,核心是提出四个优先评估领域和七项合作原则,目的是让独立评估机构能对前沿 AI 实验室的安全声明进行有深度的审查。
文件先明确了评估的定位:第三方评估不是一次性部署前检查,而是长期、与具体发布节奏解耦的深度审查,重点回答三个问题——证据是否支持实验室的安全案例与安全声明、评估是否真正测到了想测的风险、安全防护在现实条件下是否有效。OpenAI 同时强调,这类评估主要针对私营和非营利评估机构的技术安全评估,与政府测试评估是互补关系,后者因角色和责任不同需要不同做法。
四个优先评估领域如下。
第一,安全案例的独立评估。安全案例涵盖训练、能力评估和防护措施,需要对齐、控制方法(如监控)、网络安全、生物与化学滥用、红队等多领域专家共同审查。要核实的包括:安全案例的证据是否成立、训练和部署过程是否遵守了安全案例设定的条件、是否覆盖了评估中发现的最紧迫风险、训练激励机制是否有效抑制了欺骗、奖励黑客、破坏性行为或规避限制。
第二,关键防护措施的评估。OpenAI 的防护栈覆盖模型级防护、执行防护、安全防护和错位监控,横跨训练、内部部署和外部部署。评估要检验:防护在灰盒访问下能否抵御越狱和高危能力提升(如网络、生物)、智能体在真实操作条件下与访问控制、沙箱、检测响应等网络防御的交互情况、错位监控是否存在可能导致失控或严重错位的空白、思维链监控作为安全证据的可靠性、监控是否难以被禁用、防护是否与模型能力相匹配。文件特别指出,内部部署的安全标准仍不成熟,技术合作可以在当下发现防护弱点,同时为未来公共政策提供技术基础。
第三,能力评估与对齐评估的覆盖度。Preparedness Framework 要求评估覆盖化学与生物风险、网络安全、AI 自我改进等风险类别。需要检查:评估是否充分覆盖风险阈值定义、阈值设定是否合理、模型持续满分后测试是否更新并真正测出更高级能力、对齐评估是否覆盖严重错位风险以及可能遗漏的重要行为。
第四,关键错位事件的独立调查。以 OpenAI Hugging Face 事件为例,文件认为在特定情况下引入独立第三方调查错位事件是有价值的。调查需要网络取证、对齐、大规模思维链分析等专业能力,并可能涉及敏感内部数据和第三方数据。调查结果可以补充模型的安全案例,验证对齐声明和补救措施的有效性。
七项原则包括:评估前明确范围并预注册安全声明;在法律、安全和知识产权约束内提供相称的访问权限,必要时采用指定代表或隐私保护访问机制;评估方法、标准和不确定性要透明,报告要区分直接发现与解读;评估机构要证明技术专长并披露利益冲突,防止商业压力影响结论;评估机构要具备与访问敏感度相称的信息安全实践和保密保护;评估要指出具体差距并给实验室合理的修复时间;报告要基于证据尽可能公开,同时通过原则性删节政策保护敏感信息,并保持编辑独立性。
文件最后表示,OpenAI 正在与多个第三方机构就符合上述优先领域的提案进行对话,并承诺通过未来立法和私人治理机构推动建立共享的国际标准。

