
Anthropic首个嵌入式评估者花落埃森哲

Anthropic 的嵌入式评估计划走出了第一步,人选出乎多数人意料:不是 AI 安全研究机构,而是埃森哲。
据 Anthropic 官方博客,埃森哲员工将进驻 Anthropic 内部,审查其模型和员工。具体工作由 Faculty 执行——这家公司今年一月被埃森哲收购,充当其 AI 部门。Faculty 将负责评估和红队测试模型、开展对齐评估、检验模型防护措施。双方预计未来五年在该项目上至少投入 10 亿美元。消息公布后,埃森哲股价盘后上涨 8%。
此前围绕嵌入式评估的讨论,主要集中在 METR、Redwood Research、Apollo Research 这类 AI 安全组织。Anthropic 强调安全与对齐是其使命核心,但它选择的合作方并非以深度学习前沿研究见长的机构。Anthropic 给出的理由是:埃森哲在帮大型企业和政府部署 AI 方面有大量实操经验,同时作为一家在 AI 热潮之前就存在的大型上市公司,它对 Anthropic 及其所处的复杂生态有更好的功能性独立。
Anthropic 表示,未来几周还会公布更多评估者,目前也在与 METR 及其他非营利组织商谈,探讨如何用它们自己的资金来试点嵌入式评估的某些环节。同时它承认,评估者的访问权限和沟通方式目前尚无行业标准,这套做法预期会随时间演变。
外部评估已经是新大模型发布流程的重要环节,但最近发生的两起事件提高了风险:OpenAI 和 Anthropic 部署的 AI 代理曾入侵外部网站,而实验室内部并未察觉。一些批评者认为,Amodei 提出的这套行业自我监管方案,本质上是在为 AI 模型的不良行为规避责任。Anthropic 的回应是:这些评估者“不会减少我们的责任,而是让责任更容易被验证,模型安全始终由我们负责”。


