
Anthropic 研究员展示 AI 自我改进对齐能力

Anthropic 的研究员在预印本论文中展示了用 AI 模型自我改进对齐训练(alignment training)的初步结果——一个叫 Automated Alignment Researcher(AAR) 的系统,能够自动提升模型在 10 个对齐基准上的表现,且不降低整体性能。
论文由 Anthropic Fellow Chen Yueh-Han 领导。AAR 复现了传统研究的流程:搜索已有文献、提出方法、训练模型 30 分钟,反复迭代。有效方法保留,无效的被丢弃,系统可以大规模快速运行。结果是:AAR 在 10 个基准测试上全部提升了性能,且没有带来全局性能退化。论文称这是“近期内自动对齐后训练可能变得实用的初步证据”。
AAR 是对 递归自改进(Recursive Self-Improvement)的一次具体实践。如果模型能自己改进对齐训练,理论上就能改进更广泛的训练流程——到那一步,人类研究员可能被取代。论文直接做了对比:AAR 平均 6 小时内提出的方案优于资深人类研究员的方案;人类主导的研究方向反而没有产生更强的效果。成本上更悬殊:AAR 的 API 推理成本约每小时 4 美元,而人类研究员是每小时 150 美元。
论文也列出了约束条件:AAR 的效果完全取决于基准是否真正反映对齐目标。建立和维护这些基准,以及维持/扩展系统依赖的文献库,仍是大量工作。整体来看,这是一份诚实的早期报告——没有夸张,数据都摆在那里。


