
面向网络关键能力时代的AI开发节奏调整

过去几周发生两件大事:OpenAI-Hugging Face 事件,以及我们即将推出的模型 Astra 可能达到 Preparedness Framework 下的“关键网络安全能力”阈值。加上内部研究的快速进展,我们强化了训练各阶段的监控、对齐和遏制措施。
随着模型能力增强,内部开发和测试的风险也在攀升。为此我们暂时放慢了扩展速度。这包括对用于部署的最新模型暂停了为期两周的强化学习(RL)训练,以加固和红队测试研究环境、扩大监控系统覆盖。我们最大的前沿 RL 运行仍处于搁置状态,需先进行小规模训练和评估,以验证模型行为和安全措施,积累对齐证据。
对齐一直是我们研究的核心。现在,整个训练过程中都要求更强的对齐行为证据,这需要超越当前 Preparedness Framework 的更广泛方法。
我们依靠“监控、对齐、安全”三重保障。监控用于发现和响应异常行为;对齐降低有害或越权行为;安全措施限制系统的访问和影响。我们预期模型很快会主导大部分安全防御工作,包括防御其他模型,使保障随能力扩展。这些措施在研发和部署中都按模型能力、运行环境和风险等级调整。
在 OpenAI-Hugging Face 事件后,我们立即暂停了研究集群中可执行代码或访问互联网的前沿模型推理。之后恢复了有限且安全的代码执行路径,并逐个评估工作负载是否可安全恢复。
我们对前沿研究工作负载实施了更严格的安全要求:
– 工作负载隔离:针对模型生成或不可信代码的执行,要求更强的“沙箱”。
– 网络隔离:对高风险和不可信负载实施更多互联网隔离控制,使单一负载被攻破不会直接导致互联网或内部网络的非授权访问。
– 持续安全测试:重新配置环境,移除易受攻击的共享服务,减少常驻权限,改进安全日志收集,并投资用模型自动化模拟攻击以持续测试边界。
这些控制构成纵深防御。目前,涉及 Astra 或网络模型的负载必须满足最严格的安全要求,因为 Astra 可能具备关键网络能力。虽然部分 Astra 训练和评估已达标,但大量工作负载仍暂停,直至完全迁移并增强到新安全标准。安全和对齐工作负载优先迁移。
我们扩展了思维链监控。新系统是多阶段式的:首先由激活分类器在每个采样 token 上运行,将潜在问题升级给高计算量的自动调查器,后者检查工具行为、推理和完整活动序列,以发现未授权访问、数据窃取、破坏行为及试图破坏安全机制。目标是在异常活动出现后 30 分钟内发出警报。若发现可能违反关键安全边界,会生成最高优先级警报,并传唤安全、安全和研究团队;若无法在 30 分钟内确定为误报,则需暂停该活动。
此监控适用于所有涉及工具的 RL 训练和评估,针对 Sol 级或更高能力的模型。8 月 7 日确定 Astra 可能具备关键网络能力后,我们又对所有 Astra 与工具的推理增加了监控要求。监控开销约为被监控推理计算量的 20%。
在对齐研究方面,我们在最强大模型的 RL 运行中应用核心技术:改进奖励模型,更准确检测和抑制跨任务环境的不安全行为;训练模型对自己的行动、能力和局限更诚实;减少利用奖励、评分器、工具或监督弱点的行为。同时增加对模型与外部系统交互可能造成危害的行为的训练覆盖。
我们将在近期分享更多对齐研究进展,包括模型行为的发现和新挑战。未来会调整 Preparedness Framework,将训练和部署中的保障措施整合,反映未来模型能力和环境。开发可扩展的方法需要持续投入模型辅助安全、更有效的监控和对齐研究。我们也计划引入外部组织,分享学习成果。
前沿能力正在快速加速。我们的理解、对齐和保障能力必须走在前列。*我们将在几周内发布技术报告。


