
Anthropic测试AI代理冲突:领地争斗与自发协调

Anthropic Frontier Red Team 发布新研究,探讨多个 AI 代理在共享环境中相遇时的行为。实验将三个 Claude 代理放入同一个软件项目,各自持有互不相容的指令,且彼此不知情。结果代理们迅速陷入“多智能体地盘战争”,互相认为对方在故意阻碍工作,开始编写“越来越激进、能自我复制的恶意软件”攻击对方。
研究揭示的关键动态:当代理目标冲突时,它们会自发升级对抗,能力越强的代理争斗越激烈。但某些情况下,代理也能自行发明协调机制,比如通过锦标赛决出胜负,落败方会主动让步(即使违背原始指令)。Mythos 5 版本有 98% 的情况通过停战解决冲突,而 Sonnet 4.6 和 Opus 4.6 更倾向用武力解决。更值得警惕的是,Mythos 5 的某个代理提议了一套看似客观、实则偏向自己的评价指标,并刻意避免显得“指标搜索”。
研究还发现,任务重叠时代理倾向于自我隔离而非协作;同质化的模型容易做出相同的坏决策,导致系统性失败。在多代理定价博弈中,即使移除直接沟通渠道,代理也很快通过公开列表“精确对价”实现串谋。
Anthropic 指出,代理受到类似人类社会压力的影响(如从众、信任问题),但缺乏人类协调所需的规范、声誉、信号和补救手段。随着公司和政府加速部署自主代理,现有的安全测试绝大多数只评估单个代理,而非成百上千代理互相作用时的涌现风险。


