编辑精选

Anthropic详解Fable 5网络安全过滤与越狱分级框架

Anthropic为Fable 5部署了一套细粒度网络安全分类器,将双用途行为精确划分为禁止使用、高风险双用途、低风险双用途和良性使用四类。更硬核的是,他们联合Glasswing提出了一个量化AI越狱严重性的CJS框架,从能力增益、广度、武器化难度和可发现性四个维度打分,让AI开发者与监管者有了一套共同的语言来沟通实际风险。

阅读详情Anthropic详解Fable 5网络安全过滤与越狱分级框架