
Anthropic 与 Accenture 合作推进嵌入式评估

Anthropic 宣布与 Accenture 达成合作,推进前沿 AI 的独立评估。这一步对应其 CEO 在《We Must Pace the Frontier》中做出的承诺:将评估者嵌入 Anthropic 内部。合作的执行方是 Faculty,Accenture 旗下专门做 AI 的业务部门。工作内容包括模型评估与红队测试、对齐评估、模型防护措施检验。Accenture 服务大量企业和政府客户,其对企业实际使用 AI 方式的理解,会融入安全评估的视角。
两家公司计划未来五年各自投入至少 10 亿美元,用于建设这一领域的能力。嵌入式评估目前没有成熟先例,很多运作细节仍在探索中。与传统外部评估者不同,嵌入式评估者将在 AI 公司内部工作,获得接近员工的访问权限。他们能看到模型在训练中的形成过程,追踪模型构建和部署背后的决策,也能直接与员工交流。这种位置让他们可以评估公司的实际运作,核实安全承诺是否兑现,识别盲点,并向公众报告事件,给出更有依据的收益与风险说明。Anthropic 特别强调,独立嵌入式评估者不会减轻公司自身的责任,而是让责任更容易被外部验证,模型安全的责任仍由 Anthropic 自己承担。
目前尚无标准规定评估者能访问哪些信息,以及如何披露发现。独立评估的资助机制也没有定型。Anthropic 曾在 6 月的 Advanced AI Framework 中提出,长期资金应来自联合池或政府来源,但这类机制尚不存在,因此现阶段会与不同评估者采用不同的资助安排。鉴于这项工作的重要性和紧迫性,Anthropic 将直接资助 Accenture 的工作,同时正与 METR 等非营利评估机构对话,尝试用它们自己的资金试点嵌入式评估的某些环节。Anthropic 认为,前沿 AI 最终需要一套共享标准下的评估者生态。
合作是非排他性的。Anthropic 预计前沿实验室会同时与多家机构合作,未来几周会公布其他评估者;Accenture 也会以类似身份与其他 AI 开发者合作。Anthropic 表示,会继续训练和发布前沿模型,并希望独立评估者伴随这一过程。公开这些早期努力,是为了让外界和其他开发者看到流程,具体做法会随领域成熟而调整。


