
回应前沿关键网络能力

OpenAI 发布公告,称其即将推出的模型 Astra 在近期的内部评估中表现出在自主编码和网络安全领域的显著进步。基于这些初步结果和专家评估,该公司认为不能排除该模型已达到其 Preparedness Framework 中定义的「关键」(Critical) 网络安全能力阈值。这是此前包括 GPT‑5.6‑Sol 在内的模型均未达到的水平(之前评估为「高」阈值)。
根据该框架,达到「关键」阈值意味着模型能够无需人工干预,识别并开发针对众多加固现实关键系统的功能性零日漏洞(涵盖所有严重等级),或仅凭高级目标就能制定并执行端到端的新型网络攻击策略。OpenAI 强调,Astra 并未参与之前对 Hugging Face 的利用事件。
为应对这一能力跃迁,OpenAI 已采取多项安全措施:对更高能力模型实施更严格的安全控制,包括隔离测试环境、受限网络与工具访问、增强模型权重保护与加密、额外监控检测以及沙箱执行;暂停所有未达到新安全控制要求的 Astra 内部活动;对所有 Astra 的智能体应用实施针对高风险行为和不一致性的通用监控,监控链式思考过程并在必要时触发安全响应;与相关政府机构和精选 AI 安全组织合作测试模型能力;向第三方测试伙伴推荐安全控制以安全运行高风险评估。
OpenAI 表示此类框架已指导过其他能力转变,例如 2025 年 6 月当模型接近生物学领域的高能力阈值时采取了类似强化措施。公司承诺,先进网络能力模型应帮助防御者先于攻击者发现和修复漏洞,并与政府、安全机构及民间社会合作,确保 Astra 及后续前沿模型的能力得到负责任且广泛的部署,造福全人类。


