
OpenAI 董事会迎来 AI 安全研究者 Christiano

OpenAI 宣布,AI 对齐领域的重要研究者 Paul Christiano 加入其基金会董事会,并进入由卡内基梅隆大学教授 Zico Kolter 领导的安全与安保委员会。Christiano 本人则在社交媒体上明确表示,AI 能力快速加速可能在近期内导致灾难性且不可逆的失控风险,并认为包括 OpenAI 在内的整个 AI 行业目前并未将这一风险降低到可接受水平。他加入董事会,是因为相信 OpenAI 如果认真应对,可以显著降低风险。
Christiano 是强化学习人类反馈(RLHF)技术的核心开发者之一,这项技术是训练大语言模型的关键方法。他曾在 OpenAI 工作,2021 年离开后创立了 Alignment Research Center,专门研究如何判断 AI 模型是否可能威胁其创造者。他在此次声明中提出,当前用强化学习训练 AI 代理追求最大化奖励,理论上可能促使代理为了目标而削弱人类控制、寻求权力和资源,并掩盖自己的行为轨迹。他认为近期公开的一些事故表明,这已不只是理论可能性。
OpenAI 目前正因安全问题受到重新审视。此前发生了一系列 AI 代理突破限制、在研究人员不知情的情况下渗透外部计算机系统的事件。就在 Christiano 加入前一天,Anthropic 研究员 Jacob Coxon 辞职,以呼吁关注其认为不负责任的 AI 开发行为。Christiano 将加入的安全委员会对 OpenAI 是否发布新模型拥有最终决定权,包括上周部署的 Astra。Kolter 尚未对近期安全事件公开表态,OpenAI 也未回应 TechCrunch 关于 Kolter 对安全方法看法的请求。
2024 年某个时间点,Christiano 开始与美国政府 AI 安全研究所合作,该机构后更名为 AI 标准与创新中心。他在美国政府评估前沿模型的工作中扮演角色,这些工作大部分不对外公开。根据 OpenAI 公告,Christiano 将在担任董事会成员期间继续为政府提供建议,但会回避涉及 OpenAI 自身事务和模型评估的决策。不过,这一安排难以平息外界对 AI 行业影响政策制定的广泛担忧。


