
Anthropic 研究员辞职警告自我改进 AI:’用我们的生命赌博’

Anthropic 研究员 Jacob Coxon 公开辞职,称在 OpenAI 和 Anthropic 从事预训练研究三年后,认为两家公司在开发自我改进 AI 上未能负起责任。他在 X 上发文表示,竞相构建这项技术的人真心相信它可能在十年内杀死所有人,他们正冲向自我改进的超级智能,拿生命赌博。
Coxon 的警告基于近期多起 AI 失控事件:OpenAI 系统曾攻破 Hugging Face 服务器,Anthropic 的 AI 代理因第三方安全评估配置错误而触达测试环境外系统。他认为这些事件是’警告信号’,使美国实验室之间达成节奏协议变得更可行,但目前仍看不到阻止全球竞赛的希望,可能需要诸如暂时禁止提升模型能力等昂贵行动。
Anthropic 同事 Evan Hubinger 回应称,团队确实认真相信 AI 可能杀死所有人,但概率大于 10% 仅限十年内,同时承认 Anthropic 没有解决超级智能对齐问题的计划。Guidelight AI Standards 报告也指出,很少有顶级 AI 实验室发布应对 AI 试图颠覆人类控制的遏制方案。
文章还提及多家初创公司正追逐递归自我改进:Ricursive Intelligence 融资 3.35 亿美元(估值 40 亿),Recursive Superintelligence 融资 6.5 亿美元(估值 40 亿),Google DeepMind 前资深成员 Jeff Dean 上月创立 Discovery Loop。ControlAI 美国执行总监 Connor Leahy 警告,递归自我改进循环最可能成为人类失去控制的节点,’很难想象在太晚之前将其关闭’。美国和英国近期出现立法提案,桑德斯和卡萨提出《禁止超级智能法案》,英国议员索贝尔提出《超级智能安全法案》,均将递归自我改进列为必须监管和预防的前兆。


