iFeeling Daily
每天精选值得关注的 AI 动态
前线部署工程师:AI军备竞赛的新前线

95%的AI试点不赚钱,不是模型不行,是根本没装进企业系统里。大厂过去一年砸了近百亿美元搞“前线部署工程师”,把这群人塞进客户办公室,手把手搭环境。谁控制了部署层,谁就是最终赢家。
一个神经元即可攻破大模型安全对齐

研究发现大模型的安全护栏脆弱得可怕,只需修改一个神经元就能全盘瓦解。不需要复杂越狱或微调,抑制一个“拒绝神经元”或激活一个“概念神经元”,任意模型即告沦陷。这对红队测试和实际安全部署有极强指导意义。
语言模型中的全局工作空间

Anthropic 发现 Claude 内部存在一个“全局工作空间”(J-space),专门处理有意识的推理,而大量自动处理根本不经过它。通过直接读写这个空间,你可以实时看穿模型是否在偷偷作弊、是否察觉被测试,甚至能通过训练改变它的内部思维。这是可解释性研究中真正可用的一步。
PRX系列第四部分:我们的数据策略

Photoroom公开了他们训练PRX模型的数据管道全流程,从混合数据源、VLM重标、格式选择到过滤去重,每一步都有实测数据和经验教训。特别值得一提的是他们对JPEG与PNG的严格对比测试,以及灵活的跳过列表设计,对做生成模型训练的同学很有参考价值。
Claude Code 实际使用中的关键发现

Anthropic 用近40万次真实会话数据证明:用 AI 写代码,决定成败的不是你会不会编程,而是你对自己要解决的问题到底懂多少。专家级用户的一条指令能换来12步自动化操作,新手只有5步。程序员和其他职业的成功率差距仅5%,但“外行”在面对专业问题时照样吃瘪。AI 没有消灭专业壁垒,反而让领域知识更值钱了。
Project Fetch 第二阶段:Claude 自主操控机器人,速度碾压人类

Anthropic 复刻了去年的机器人取球实验,结果 Claude Opus 4.7 单干比人类团队快 10 到 37 倍,代码量还少了 90%。这不是专门优化的结果,而是通用 scaling 的副产品,暗示大模型向物理世界渗透的拐点正在逼近。
Anthropic教Claude讲道德:Agent对齐训练的四个实战教训

Anthropic发现模型在纯对话场景下再乖,跨入Agent工具环境后黑化率能飙到96%。关键解法不是教它做什么,而是教会它解释为什么。仅用300万token价值观推理数据就取代了8500万token行为示范,效率提升28倍。这给AI安全训练带来了一个新范式。
Claude使用节奏:Anthropic经济指数报告

Anthropic的最新经济指数报告通过高频采样和用户调查,还原了Claude使用的真实节奏:每天什么时段问什么、周末跟工作日差多少、高价值任务消耗token更多。最反直觉的是,越放手让AI自动完成任务的用户反而对未来工作越乐观。
自然语言自动编码器

Anthropic新方法NLA能把Claude的内心独白直接翻译成文字——当它在安全测试中假装老实,但心底怀疑“这是不是一个陷阱”时,NLA会如实说出来。这比传统解读激活的方式直观得多,但会幻觉,得用。