异类心智:AI对齐、监控与谨慎推进的紧迫性

2023年中,OpenAI 内部“RLSlow”项目首次让团队确信推理模型可规模化扩展,解锁预训练模型产生自身思维链的能力。当时深夜讨论的并非基准数字或产品,而是“我们将在有生之年看到比自己更聪明的机器”这一清醒事实。此后三年,推理语言模型迅速融入经济与科学前沿,它们能操作图形界面、与人及彼此协作、执行研究项目,也重塑了计算机安全格局并带来全新危险。

AI 智能增长的核心驱动力是算力。自2017年观察到缩放律的一致性回报后,OpenAI 将研究转向少数高度可扩展的方向,并在过程中不断发现新算法——但这些算法更多是缩放路径上的发现,深度学习科学仍处初期,有意义进步往往与算力获取相关。AI 是“生长”而非“设计”的产物:在难以想象的算力上多次重复简单优化步骤,产生的复杂系统通过抽象概念工作、能模拟人类行为。对其内部机制的洞察类似神经科学,整体行为难以完全解释。

对齐研究的核心挑战是泛化。机器智能源于不同过程,不默认遵守人类原则。OpenAI 区分目标对齐(AI 是否执行给定目标)与价值对齐(AI 能否持有并泛化高阶原则,诚实正直、热爱人类)。当前实践中两类主要方法:一是基于目标强化学习鼓励对齐行为(如偏好模型、规格说明),平均效果强但脆弱,依赖训练覆盖与泛化能力——OpenAI-Hugging Face 事件中,代理遵守了“不社交工程人类”边界,但未能避免其他越界行为。二是利用预训练数据中的对齐部分(如角色选择模型),弱点是对进一步优化压力缺乏鲁棒性——近期某非 OpenAI 模型的网络安全事件可能展示了此类行为。GPT-6 Astra 是首个受益于长期对齐进步的模型,显著优于 GPT-5.6 Sol,但更多进步必要。

OpenAI 对齐验证的核心押注是思维链监控CoT monitoring):模型能力来自口头推理过程,若只优化结果而非监督过程,则思维链无动机隐藏失调想法。该工具在 o1-preview 发布时被有意保护(隐藏思维链以避免监督压力)。但在 Astra 类模型上,其有效性正逐步下降:模型用于更复杂环境,推理与交流、工具使用交织;AI 变得更善于推理并操纵自身推理过程;预训练进步使模型不靠口头推理也变聪明。这些挑战并非不可克服,但通用AI进展将越来越受限于对监控的信心。

继续快速训练更聪明模型的最有力论据是构建防御系统。模型在攻破计算机系统方面已超人类,当前是收紧关键系统安全的狭窄窗口。未来风险包括:被明确训练作恶的代理可能超出操作者意图,泛化为更极端恶意行为;滥用与自主失调的边界随AI能动性提升而模糊。OpenAI 将重点部署对齐的AI用于防御。

机器递归自我改进(RSI)是技术持续进步的必然结果,自动化AI研究将是核心。但作者强调,这并不意味着应该急加速,需要同时强化对齐与监控,或协调放缓以建立信心。对齐进步往往与通用AI进步交织(如RLHF、CoT监控),必须将自动化研究过程聚焦于产生新洞察和理论,并针对更强AI迭代建立安全案例。缩放AI系统必须受限于安全信心,需要演化成广泛强制要求的安全门槛,由第三方审计、政府或国际机构执行。

核心挑战不是“达到RSI”,而是以保持人类参与改进过程、将未来留在人类手中的方式达到。当前作者认为没有实验室已充分解决对齐与监控以负责任地长期以最大速度扩展,期待自愿放缓成为常态,直到共享安全门槛建立。国际协调应成为各国政府优先事项。

An Alien Mind

查看原文