
Anthropic 呼吁制定 AI 国际安全标准

Anthropic 发布了一份政策框架文件,阐述其对 AI 发展下一阶段的立场,核心聚焦于构建国际技术标准,以确保 AGI 安全并惠及全人类。文件明确提出了三大优先目标:开发自动化 AI 研究员(Automated AI Researcher)以推进对齐研究;将先进智能的成果转化为科学进步与经济增长;以及赋能个人拥有专属的 AGI。Anthropic 认为,自动化 AI 研究(Automated AI Research)将显著加速 AI 发展,但这同时带来了递归自我改进(RSI)的风险,即 AI 系统在人类参与下不断迭代自身能力,可能导致发展速度失控。因此,安全地驾驭这一过渡期,关键在于对齐研究要跟上能力发展的步伐。
文件特别强调,防止人类失去对 AI 发展实际控制的重要性。Anthropic 明确表示,目前不应追求完全自主的 RSI,除非能确保其安全,且必须在人类监督和民主决策的框架下进行。它援引此前披露的“Hugging Face 事件”作为警示,指出若无健全保障,此类风险可能急剧放大。为此,Anthropic 主张由美国牵头,联合其他国家制定前沿 AI 的国际通用标准。这些标准将涵盖几个关键维度:评估与 RSI 相关的 AI 进展和自动研究水平、确立自动化 AI 研究中的人类监督规范、建立对齐失败的分类与事件报告机制等。文件认为,国际标准有助于解决 AI 发展碎片化、监管能力不均等全球性问题,并与现有机构如 ISO 及美国国家标准学会(ANSI)等协同。
在治理路径上,Anthropic 明确反对将技术标准作为强制许可、预先审查或许可批准的要求。其愿景是建立一套透明、不偏袒特定国家或商业模式的标准,通过国际合作(如美中对话)和公私伙伴关系来应对前沿 AI 带来的国家安全挑战。文件强调,保持美国的主导地位和全球合作机制是塑造 AI 治理框架、避免全球陷入各自为政或冲突状态的关键一步。


