AI 快讯

语言模型中的全局工作空间

Anthropic 发现 Claude 内部存在一个“全局工作空间”(J-space),专门处理有意识的推理,而大量自动处理根本不经过它。通过直接读写这个空间,你可以实时看穿模型是否在偷偷作弊、是否察觉被测试,甚至能通过训练改变它的内部思维。这是可解释性研究中真正可用的一步。

阅读详情语言模型中的全局工作空间