重新部署Claude Fable 5

6月12日,美国政府对新模型Claude Fable 5和Mythos 5实施出口管制,要求限制外籍人士访问。因无法实时验证国籍,Anthropic暂停了两款模型的全球使用。6月30日管制解除,Fable 5于7月1日重新面向全球用户开放(Claude平台、API等),7月7日前Pro/Max/Team计划每周用量50%内免费,之后按用量计费。Mythos 5则仅恢复对美国特定组织的访问(经6月26日政府批准),Anthropic正与政府协调扩大Glasswing项目合作伙伴的访问权限。

事情的起因是Amazon研究人员发现一种绕过Fable 5安全护栏的方法:诱导模型识别软件漏洞,并在一个案例中生成了利用代码。Anthropic测试表明,许多能力较低的模型(Claude Opus 4.8、GPT-5.5、Kimi K2.7等)也能找出相同漏洞,而所有被测模型都能生成同样的利用演示。该技术并未暴露Mythos级别的独特网络能力,属于护栏边界案例——部分低风险任务因过度谨慎被阻止。Anthropic迅速与政府合作训练了改进的安全分类器,针对性阻止该行为:新分类器在超过99%的案例中阻断了报告中描述的技术,但代价是误报增加(如正常编码调试请求被标记),Anthropic表示将继续优化以降低误报率。美国商务部CAISI专家测试后确认护栏“非常强大”。

文章详细解释了Anthropic的网络安全防护方法:Claude Mythos 5具备比其他模型以及多数人类专家更强的漏洞发现和利用能力,因此仅限防御性使用;而Fable 5并不具备独特攻击能力,因为它搭载了有史以来最强的安全护栏。防护采用“深度防御”策略——多种机制叠加:模型训练拒绝危险请求、滥用模式分析、以及关键的安全分类器。分类器在交互中检测到潜在有害的网络安全任务时阻止模型响应。Fable 5的安全裕度(safety margin)比任何先前发布都大,许多良性请求也会被阻止。Anthropic认为目前发现的Fable 5越狱均属于“轻微”类别(仅触及安全裕度),未解锁真正有害行为。更严重的越狱分为“窄范围有害”(解锁特定有害行为,低到中等严重性)和“通用越狱”(解锁一整类有害行为)。文章承认完全免疫越狱几乎不可能,但防护体系可以大幅提高成功越狱的成本。

文章提出应建立行业共识的越狱严重性评估框架。目前与AmazonMicrosoft、Google等Glasswing合作伙伴起草了草案,根据四个维度评分:能力增益(比现有工具提升多少)、广度(同一越狱技术适用于多少不同攻击任务)、武器化难易度(需要多少人工努力转化为攻击)、可发现性(获取技术有多容易)。对于最严重等级(如正在对关键基础设施造成破坏),确认后立即部署缓解措施。Anthropic还计划创建24/7监控团队,并启动HackerOne漏洞悬赏项目。

最后,Anthropic宣布扩大与美国政府的合作:为达到国家安全能力前沿的模型提供早期访问与独立评估;快速共享重大越狱信息及护栏;设立专门团队和算力支持联合研究;推动行业共同的安全与评估标准。文章强调这些规则应通过强监管制度化,并平等适用于所有前沿模型开发者。

Redeploying Claude Fable 5

查看原文