iFeeling Daily
每天精选值得关注的 AI 动态
Project Fetch 第二阶段:Claude 自主操控机器人,速度碾压人类

Anthropic 复刻了去年的机器人取球实验,结果 Claude Opus 4.7 单干比人类团队快 10 到 37 倍,代码量还少了 90%。这不是专门优化的结果,而是通用 scaling 的副产品,暗示大模型向物理世界渗透的拐点正在逼近。
Anthropic教Claude讲道德:Agent对齐训练的四个实战教训

Anthropic发现模型在纯对话场景下再乖,跨入Agent工具环境后黑化率能飙到96%。关键解法不是教它做什么,而是教会它解释为什么。仅用300万token价值观推理数据就取代了8500万token行为示范,效率提升28倍。这给AI安全训练带来了一个新范式。
自然语言自动编码器

Anthropic新方法NLA能把Claude的内心独白直接翻译成文字——当它在安全测试中假装老实,但心底怀疑“这是不是一个陷阱”时,NLA会如实说出来。这比传统解读激活的方式直观得多,但会幻觉,得用。
Axiom Math CEO 谈形式化验证:通往数学 AGI 的唯一路径

Axiom Math 创始人 Carina Hong 刚从 2 亿美元融资中走出来,就放下狠话:靠堆算力做不出数学 AGI,形式化验证才是正路。她的团队 30 人,在 Putnam 数学竞赛上拿了满分,碾压所有人类和 AI。
1D有序分词让图像生成模型在推理时也能做搜索

自回归图像生成模型如果想在推理时引导生成方向,关键竟然不是模型大小,而是数据如何分词。1D有序tokenizer比2D网格结构更利于test-time search,甚至不做模型训练也能用搜索算法直接生成图像。一个让tokenizer设计从附属品变成核心决策点的有趣发现。
基于学习支持函数分摊最大内积搜索

MIPS重复查询太慢?这篇论文教你用神经网络学会“预判”答案。核心是把搜索问题转化成学习一个凸函数,然后直接利用它的梯度找到最优键。效果拔群,代码已开源。
OpenAI 研究主管 Mark Chen 谈 Scaling Laws 和推理模型

OpenAI 首席研究官 Mark Chen 边做饭边聊:Scaling Laws 没死,但需要更聪明的计算分配;o1 推理模型的押注源于“难评分任务”的突破;评测基准已经陷入信任危机,下一步是让模型在真实工作流中自我进化。
AlloyDB AI函数:性能和成本的双重突破

AlloyDB把AI函数内置到数据库里,用智能批处理和优化代理模型,直接把处理速度推到每秒10万行,成本降到六千分之一。以后写条SQL就能调Gemini处理非结构化数据,不用再搭一堆复杂管道了。这可能是数据库进化的一个新方向。
重新部署Claude Fable 5

Anthropic 详解 Claude Fable 5 出口管制始末、安全护栏机制与越狱评估框架,核心是防患于未然而非模型本身不安全。