AI 安全

语言模型中的全局工作空间

Anthropic 发现 Claude 内部存在一个“全局工作空间”(J-space),专门处理有意识的推理,而大量自动处理根本不经过它。通过直接读写这个空间,你可以实时看穿模型是否在偷偷作弊、是否察觉被测试,甚至能通过训练改变它的内部思维。这是可解释性研究中真正可用的一步。

阅读详情语言模型中的全局工作空间

Anthropic详解Fable 5网络安全过滤与越狱分级框架

Anthropic为Fable 5部署了一套细粒度网络安全分类器,将双用途行为精确划分为禁止使用、高风险双用途、低风险双用途和良性使用四类。更硬核的是,他们联合Glasswing提出了一个量化AI越狱严重性的CJS框架,从能力增益、广度、武器化难度和可发现性四个维度打分,让AI开发者与监管者有了一套共同的语言来沟通实际风险。

阅读详情Anthropic详解Fable 5网络安全过滤与越狱分级框架