
研究人员用Anthropic的Claude攻破OpenAI

独立安全团队 Hacktron AI 的三名研究员,用 Anthropic 的 Claude 模型攻破了 OpenAI 的内部系统。这起事件由《华尔街日报》率先报道,是一次 OpenAI 漏洞奖励计划下的授权测试。Hacktron 最终拿到 $6,500 奖金,OpenAI 表示已修复相关问题。
攻击入口是 OpenAI 社区论坛所用的第三方软件 Discourse。7月25日,研究员发现了一个看似普通的图片上传流程存在漏洞:当用户上传 HEIF/HEIC 格式图片(iPhone 默认格式)时,Discourse 会调用 ImageMagick 做转换,再交给 libheif 库解码。libheif 内部一个内存 bug 允许攻击者通过特制图片劫持服务器。这个 bug 其实早在几个月前就被 libheif 开发者修复,但修复从未被正式标记为漏洞,没有获得 CVE 编号,导致 Discourse 仍在运行存在缺陷的版本。
真正值得注意的转折点是模型能力:研究员最初使用的 Claude 版本(面向网络安全研究员的 Opus 4.8 特别版)多次尝试都未能构造出可用的 exploit。当 Anthropic 发布 Opus 5 后,几个小时内它就解决了同一个问题。Hacktron 在博客中明确写道:“Opus 4.8 在多次会话中苦于无法产出有效 exploit,而 Opus 5 发布数小时内,我们给了它同样的问题,它成功了。”成功攻入 Discourse 服务器后,团队又发现另一个漏洞,可以接管 ChatGPT 和 Codex 账户,包括 OpenAI 员工的账户。他们接管了一位 OpenAI 员工的账户,其 Codex 已连接 OpenAI 的 GitHub 组织。随后团队向 OpenAI 和 Discourse 报告,Discourse 在 7月27日发布修复。
这件事冲击了网络安全界的两个常见假设。第一,修复不公开(没有 CVE)等于没修,供应链中下游很容易继续使用有问题的版本。第二,前沿模型的攻击能力正在快速提升,而安全防御并没有同步跟上。Gray Swan CEO Matt Fredrikson 的话很直接:花 $200 一个月,任何人都能用这些工具入侵像 OpenAI 这样的公司;如果连 OpenAI 都无法幸免,那谁都有可能。
事件也引发了关于模型出口限制的讨论。Claude Opus 5 没有受到安全出口限制,而更新版本的 Mythos 5 因被担忧有高级黑客能力而暂时被封锁。开放权重模型也在追赶。AI 安全非营利组织 SaferAI 发现,中国公司 Z.ai 的 GLM-5.2 在网络攻击能力上只落后 OpenAI GPT-5.5 和 Anthropic Claude Opus 4.7 几个月。Hacktron 创始人总结说,AI 正在降低开发 exploit 所需稀缺专业知识的门槛,过去需要数月的工作现在只需数天。


