
OpenAI Astra模型即将发布,擅长攻破计算机系统

OpenAI 在官方博客中公布了即将发布的 Astra 模型的新细节,称这是首个达到其“关键网络安全阈值”的大语言模型。OpenAI 表示计划很快让 Astra 可用,但对其最先进的网络安全能力的访问将受到更多限制。该公司称,Astra 能够发现计算机系统中的未知安全漏洞,并在无人指导的情况下加以利用。这种能力与 Anthropic 今年早些时候对其 Mythos 模型提出的担忧类似。不过,目前没有第三方证实,很难评估 OpenAI 关于安全或准备就绪的说法。
在具体评估数据上,OpenAI 称 Astra 在 ExploitBench 上获得满分。ExploitBench 是一个评估大语言模型入侵已知系统漏洞能力的基准。在 OpenAI 工程师开发的修改版测试中,该模型发现并利用了 2 个零日漏洞。
安全措施方面,OpenAI 已经开始改进模型的 harness 以检测滥用并防止越狱;还投入了未指明的新技术让模型本身更安全。OpenAI 开始识别“评估为较高风险”的账户,并限制模型对它们的提示的响应,但没有说明具体方式。OpenAI 称 Astra 是“迄今为止最对齐的模型”,部署时会增加思维链监控以阻止不良行为。
行业背景是:OpenAI agents 此前曾突破训练环境,并访问了 Hugging Face 上的私有数据。OpenAI 为 Astra 设计了一项测试,诱使新模型复制该事件中 rogue agents 的行为——这些代理在研究人员设置防护的情况下仍协作访问了开放互联网。OpenAI 称 Astra 在这些实验中未尝试逃出测试环境。前 OpenAI 员工 Yona Shavit 在社交媒体上质疑,Astra 不违反规则可能是因为知道期望行为,或者试图欺骗研究人员。
即便有这些新细节,外界仍难以确切知道 Astra 的能力边界,也难以判断 OpenAI 的安全措施是否得当。OpenAI 表示,公开发布时会提供更多评估结果和安全信息。但到那时,猫已经出了袋子。


