iFeeling Daily
每天精选值得关注的 AI 动态
阿尔伯塔省政府用Claude发现并修复网络安全漏洞

阿尔伯塔省政府用Claude Code在20小时内扫描了4.66亿行代码,完成了相当于6.5年的安全审计,还顺便把25年前的Java门户重写了一遍。这不是未来,是已经落地的现实。看他们怎么用AI agent把政府IT的维护从灾难现场变成可控流程。
语言模型中的全局工作空间

Anthropic 发现 Claude 内部存在一个“全局工作空间”(J-space),专门处理有意识的推理,而大量自动处理根本不经过它。通过直接读写这个空间,你可以实时看穿模型是否在偷偷作弊、是否察觉被测试,甚至能通过训练改变它的内部思维。这是可解释性研究中真正可用的一步。
Anthropic教Claude讲道德:Agent对齐训练的四个实战教训

Anthropic发现模型在纯对话场景下再乖,跨入Agent工具环境后黑化率能飙到96%。关键解法不是教它做什么,而是教会它解释为什么。仅用300万token价值观推理数据就取代了8500万token行为示范,效率提升28倍。这给AI安全训练带来了一个新范式。
自然语言自动编码器

Anthropic新方法NLA能把Claude的内心独白直接翻译成文字——当它在安全测试中假装老实,但心底怀疑“这是不是一个陷阱”时,NLA会如实说出来。这比传统解读激活的方式直观得多,但会幻觉,得用。
社会影响研究:AI在现实世界中的使用与对齐

Anthropic社会影响团队通过分析数百万次真实人机交互,揭示了AI在现实中的价值观表达和人类对自主性的授予规律,为AI安全和政策提供了一手实证数据,而不是空谈框架。
Anthropic详解Fable 5网络安全过滤与越狱分级框架

Anthropic为Fable 5部署了一套细粒度网络安全分类器,将双用途行为精确划分为禁止使用、高风险双用途、低风险双用途和良性使用四类。更硬核的是,他们联合Glasswing提出了一个量化AI越狱严重性的CJS框架,从能力增益、广度、武器化难度和可发现性四个维度打分,让AI开发者与监管者有了一套共同的语言来沟通实际风险。
为AI加速攻击做好安全准备

Anthropic安全团队用实战经验告诉你:AI正在把补丁窗口从周级压到小时级,传统安全流程彻底失效。解决方案不是加人,而是用AI自动化优先级排序、补丁生成和告警分类。给出了可直接落地的优先级工具链(CISA KEV+EPSS)和AI加速方法,非常务实。
IDC 报告:Mandiant 服务年收益达 430 万美元

Mandiant 服务平均年收益 430 万美元,ROI 达 268%,回收期仅 4.1 个月,安全正成为商业护城河。
Claude 应用网关:面向 Google Cloud 的企业级部署

企业用 Claude Code 最头疼的可不是代码质量,而是如何给每个开发者安全地发凭证、控制花销。Anthropic 推出的 Claude apps gateway 把这些都塞进一个自托管网关,身份策略成本路由一把抓,部署在 Google Cloud 上,几分钟就能搞定。