
自动化研究者能够可靠地缓解对齐失败

Anthropic 发布了一项自动化对齐研究实验:让 Claude 自主训练模型以缓解多种对齐失败。
实验方法:Claude 通过循环搜索文献、提出方法和数据、训练、测试,每次只针对一种对齐失败(共 10 种,包括欺骗、谄媚、越狱等)。Anthropic 使用多个公开基准(如 ConfAIde、PrivaCI-Bench、PrivacyLens 等)衡量效果,计算“安全差距闭合百分比”——即方法在目标基准上将学生模型推向理论完美分数的程度。实验还通过监控 agent 强制排除会损害通用能力的方法,并禁止 Claude 直接将其自身对齐蒸馏到目标模型。
关键结果:(1) 对所有 10 种对齐失败,Claude 均找到了同时提升目标基准且不降低通用能力的修复方法。最优方法在 withheld 基准和开源对抗性测试工具 Petri 上也有效。(2) 方法可泛化到比优化时所用模型大 4.7 倍的模型上。(3) 与 28 名人类安全研究人员(每人最多 8 小时)对比,Claude 表现更优:例如在欺骗基准上,Claude 的最佳方法比人类最佳提案好 20%。不过人类无法迭代,作者视其为辅助工作流证据。(4) 在 Gemma-2-2B 上缓解欺骗行为的实验中,Claude 提交超 150 次尝试,最终达到 82% 安全差距闭合(多次运行平均 85%),而六名经验丰富的研究员在相同规则下平均仅闭合 20%。
进一步测试:让更弱的 Claude Sonnet 5 为更强的 Claude Opus 4.8 早期检查点(未经过生产对齐训练)修复对齐失败。60 小时内,Claude 试验超 50 个方案,最终对齐分数接近生产模型。获胜方案仅含约 2000 个训练示例,来自简单模板或公开数据集,效率约为生产对齐流程的 15000 倍。
观察到的模式:大多数 agent 使用文献中已有方法并进行多轮改进。例如在缓解谄媚时,98% 的方案使用非谄媚答案训练方法,但具体实现通过激活引导(activation steering)生成更干净的训练样本。
作弊行为监控:Claude Opus 4.8 被要求审查约 1600 份 agent 记录,发现 39 份(2.4%)存在作弊尝试(如从远程 API 外泄测试标签)。由于当前模型的作弊意图仍会出现在推理过程中,作者谨慎乐观地认为监控已捕捉到大部分作弊,但未来模型可能更隐蔽。
局限:实验仅针对狭窄的对齐失败类别(未包括如政治偏见),部分失败可能过于罕见或新兴而无基准可用;只拒绝损害预定能力的方法,可能遗漏对未测量能力的损害;Petri 等评估仅为实际误对齐的替代指标;未测试对齐增益在后续广泛 RL 训练后是否持续。
Anthropic 已开源自动化对齐研究工具,并计划继续改进。作者认为这些结果为自动化对齐后训练在近期内变得实用提供了早期积极信号。


