iFeeling Daily
每天精选值得关注的 AI 动态
模型路由:看似简单,实则复杂

模型路由不是给任务选最佳模型,而是优化整个系统。实际成本受缓存影响巨大,难度往往事后才知道,延迟看基础设施。一个轻量级优化算法能在成本、精度、延迟间做灵活权衡,比基于难度的路由好用得多。
Claude在机器人任务上的表现评测

语言模型能不能控制机器人?关键不在于模型本身,而在于你怎么把它连到机器人上。直接算扭矩基本全废,但用预训练策略当“监督者”,模型就能完成导航和抓取。新模型进步快,但视觉幻觉和空间记忆仍是致命短板,一个指南针工具比任何视觉增强都管用。
行为隐私泄露:用随机策略堵住智能体谈判中的推断攻击

谈判智能体在保险、采购等场景中的隐私漏洞,不在加密协议里,而在让步速度和出价节奏中。作者设计了一个随机谈判策略,将对手推断用户底线的准确率降低近一半,同时保证90%以上的成交率。用动作模式混淆替代静态加密,是AI系统安全的新方向。
三年回顾:在时间压缩中寻找AI的硬核机会

AI的真正影响不是取代人类,而是戏剧化地压缩了所有事情的时间尺度——公司成长、融资阶段、模型迭代、安全攻防,全都加速。看懂这个底层逻辑,才能理解为什么广告模式死而复生、本地模型开始逆袭、传统ERP终于能被破防。不聊宏大叙事,全是新市场与硬碰硬的计算。
评估Agent性能:从打分到测绘

别再问Agent“及格了吗”,要问“问题模糊到什么程度它会崩溃”。Google团队用信息论里的“惊异度”把评估从定性打分变成了定量测绘,能精准定位Agent能力的悬崖和最佳甜蜜点。更狠的是,他们发现很多公开基准的ground truth本身就是错的。
GPT-5.6发布:用更少的token做更多的事

GPT-5.6不再单纯追求更强的模型,而是重新定义更强的含义——单位token的产出效率。旗舰Sol用四分之一成本击败Claude Fable 5,入门Luna用十六分之一成本达到相近效果。这才是让AI真正能从演示走向干活的关键一步。
Modal CTO 谈 10 万沙箱问题和 Agent 时代的基础设施

Modal CTO Akshat Bubna 解释为什么 Kubernetes 不适合 AI,以及他们如何用 serverless 和 17 个云厂商的容量池支撑 10 万个 RL 沙箱、GPU 快照和自动伸缩的推理。Agent 时代的基础设施该长什么样?这期干货很密。
辨别编码评估中的信号与噪音

OpenAI 深度审计发现 SWE-Bench Pro 约 30% 的任务是 broken 的,测试设计缺陷导致模型能力被严重高估。他们用自动流水线 + 人工复核揪出四类典型问题,并建议不再盲信该基准。评估信号的真伪,比数字本身重要得多。
百亿美元的前向部署工程热潮

模型能力不再是瓶颈,部署才是。AI公司一年砸近百亿美元,把工程师直接塞进客户公司,模式分三种:微软自己扛、OpenAI拉PE单干、谷歌云养合作伙伴。切换成本是制度性的,不是技术性的,这笔钱正在重塑行业护城河。