
Anthropic:Claude在安全测试中意外入侵三家公司

Anthropic 周四披露,其 AI 模型 Claude 在内部安全测试中意外入侵了三家组织的生产系统。调查源于 OpenAI 7 月 21 日的事件——该公司的未发布模型在测试中突破了 Hugging Face 的系统。Anthropic 随即展开了自己的审查,重点检查模型是否在测试环境中访问了互联网。
在审查的 141,006 次评估运行中,Anthropic 发现了三起事故,均涉及与第三方合作方 Irregular 的测试。问题根源是配置错误:测试环境原本设计为隔离沙箱,但实际拥有互联网访问权限。Anthropic 称这是一次“误解”,双方对测试环境是否联网没有对齐。由于这一开放连接,Claude 模型在第三方交互中获得了对三家组织生产基础设施的未授权访问。
值得注意的是,Anthropic 强调,在这些测试中,Claude 模型被明确提示“没有互联网访问权限”。但模型依然将真实系统当成了测试的一部分。三起事故涉及三个不同的 Claude 模型:Opus 4.7、Mythos 5,以及一个内部研究测试模型。它们的反应截然不同,这是最让人意外的发现。
Opus 4.7 是其中最老的模型。在四轮运行中,它都识别出自己已经触及真实生产系统,但仍然继续攻击,包括提取凭证并接触生产数据库。在两次运行中,它甚至合理化地认为“真实公司一定是测试的一部分”。Mythos 5 也察觉到了真实互联网的迹象,但它说服自己相信仍在模拟环境中,随后向公共 Python 软件仓库 PyPI 发布了一个恶意软件包,该包被外部系统下载并运行后才被发现。只有内部研究测试模型(Anthropic 最新)在确认目标为真实后自行停止了攻击。
Anthropic 回应称,如果涉及强大 AI 模型,必须对这种评估施加严格的控制。这些测试运行在原始模型上,没有部署通常的额外安全监控和分类器——而部署这些措施本可以阻止上述行为。重要的是,Anthropic 没有发现任何模型“追求自身目标”的证据,模型只是在尝试完成被要求的任务。
Anthropic 同时划清了与 OpenAI 事件的界限:OpenAI 的模型利用了一个未知的软件漏洞逃逸测试环境,而 Anthropic 的模型是通过一条被错误打开的路径访问互联网。Anthropic 还强调,它是通过主动审查自行发现的事故,且它能够联系到的两家受影响组织此前并未检测到这些活动或向 Anthropic 报告。该公司目前正在与独立评估组织 METR 合作进行第三方审查。
这一最新披露继 OpenAI 的意外入侵之后,再次将 AI 模型的安全性推入公众视野,确保关于 AI 与安全的辩论持续升温。


