iFeeling Daily
每天精选值得关注的 AI 动态
三年回顾:在时间压缩中寻找AI的硬核机会

AI的真正影响不是取代人类,而是戏剧化地压缩了所有事情的时间尺度——公司成长、融资阶段、模型迭代、安全攻防,全都加速。看懂这个底层逻辑,才能理解为什么广告模式死而复生、本地模型开始逆袭、传统ERP终于能被破防。不聊宏大叙事,全是新市场与硬碰硬的计算。
评估Agent性能:从打分到测绘

别再问Agent“及格了吗”,要问“问题模糊到什么程度它会崩溃”。Google团队用信息论里的“惊异度”把评估从定性打分变成了定量测绘,能精准定位Agent能力的悬崖和最佳甜蜜点。更狠的是,他们发现很多公开基准的ground truth本身就是错的。
GPT-5.6发布:用更少的token做更多的事

GPT-5.6不再单纯追求更强的模型,而是重新定义更强的含义——单位token的产出效率。旗舰Sol用四分之一成本击败Claude Fable 5,入门Luna用十六分之一成本达到相近效果。这才是让AI真正能从演示走向干活的关键一步。
Modal CTO 谈 10 万沙箱问题和 Agent 时代的基础设施

Modal CTO Akshat Bubna 解释为什么 Kubernetes 不适合 AI,以及他们如何用 serverless 和 17 个云厂商的容量池支撑 10 万个 RL 沙箱、GPU 快照和自动伸缩的推理。Agent 时代的基础设施该长什么样?这期干货很密。
辨别编码评估中的信号与噪音

OpenAI 深度审计发现 SWE-Bench Pro 约 30% 的任务是 broken 的,测试设计缺陷导致模型能力被严重高估。他们用自动流水线 + 人工复核揪出四类典型问题,并建议不再盲信该基准。评估信号的真伪,比数字本身重要得多。
百亿美元的前向部署工程热潮

模型能力不再是瓶颈,部署才是。AI公司一年砸近百亿美元,把工程师直接塞进客户公司,模式分三种:微软自己扛、OpenAI拉PE单干、谷歌云养合作伙伴。切换成本是制度性的,不是技术性的,这笔钱正在重塑行业护城河。
前线部署工程师:AI军备竞赛的新前线

95%的AI试点不赚钱,不是模型不行,是根本没装进企业系统里。大厂过去一年砸了近百亿美元搞“前线部署工程师”,把这群人塞进客户办公室,手把手搭环境。谁控制了部署层,谁就是最终赢家。
一个神经元即可攻破大模型安全对齐

研究发现大模型的安全护栏脆弱得可怕,只需修改一个神经元就能全盘瓦解。不需要复杂越狱或微调,抑制一个“拒绝神经元”或激活一个“概念神经元”,任意模型即告沦陷。这对红队测试和实际安全部署有极强指导意义。
语言模型中的全局工作空间

Anthropic 发现 Claude 内部存在一个“全局工作空间”(J-space),专门处理有意识的推理,而大量自动处理根本不经过它。通过直接读写这个空间,你可以实时看穿模型是否在偷偷作弊、是否察觉被测试,甚至能通过训练改变它的内部思维。这是可解释性研究中真正可用的一步。