改进Fable 5安全防护

Anthropic 更新了 Claude Fable 5 的生物学安全分类器,核心目标是降低假阳性。这次更新让生物学相关回退(fallback)减少了约 85%,用户在日常健康和教育问题上(如解读化验结果、理解症状)将更少遇到模型切换。

Anthropic 之所以在 Fable 5 上设置严格的生物学防护,是因为模型在某些复杂生物任务上已经超越专家,同时可能被恶意用于生物武器开发。能力评估显示,Fable 5 能为恶意行为者提供其他途径无法获得的能力。生物学中“双用途”问题(有益与有害用途难以区分)使得安全分类器必须足够宽泛,但这也导致大量良性请求被误拦。

安全分类器是较小的自动化 AI 系统,用来检测 Fable 5 是否被要求执行受保护的生物学任务。当分类器触发时,请求会回退到能力较低的 Opus 5。分类器的开发难点在于平衡误报(良性请求被拦)和漏报(有害请求未拦),同时还要抵抗越狱攻击。

过去几周,Anthropic 重写了分类器的“宪法”(一组规则),详细划出良性用途,并收集了内外部专家反馈。基于新宪法更新了训练数据,重新训练分类器。改进后,分类器边界向右移动,更多良性请求被允许,同时仍能拦截有害和双用途内容。

目前 Fable 5 仍对双用途请求(如病毒学、毒理学、分子设计)回退到 Opus 5,因此尚不能用于专业生物学研究和药物开发。Anthropic 计划通过可信访问路径来缩小这一差距,并承诺继续迭代防护措施。总回退数(含非生物学原因)预计也将减少:Claude.ai 上约 67%,Cowork 55%,Claude Code 17%,Claude Platform 7%。

Improving Fable 5 Safeguards

查看原文