iFeeling Daily
每天精选值得关注的 AI 动态
LVSum:时间感知的长视频摘要基准

长视频摘要的真相:模型严重依赖转录文字,视觉帧几乎不贡献;而且它们对时间顺序的理解一塌糊涂。如果你做视频AI,LVSum是检验模型真实能力的试金石。
开源追赶闭源的循环赛

开源模型没必要领跑,只要能把闭源模型的利润空间压缩 90%,就能把整个市场卷得更快。这不是一场谁赢的比赛,而是一个互相加速的飞轮:闭源做创新,开源做商品化。
YouTube 细化 AI 内容变现规定

YouTube 正式细化 AI 内容变现规则,明确禁止三类低质量视频:模板化重复内容、刻意博眼球的痛苦视频、以及用 AI 角色讨论敏感话题。这不是封杀 AI,而是在给 AI 创作的收益划定清晰底线。
RayRoPE:让多视角Transformer真正理解3D几何的位置编码方案

多视角Transformer的核心痛点:传统编码要么认像素坐标,要么认光线方向,但都丢了真实3D几何关系。RayRoPE用一个巧妙思路——把预测的3D点投影到查询帧做编码,再算不确定性,结果LPIPS直接提了15%,结构很优雅,实用性极强。
Kimi K3引发的开源AI恐慌背后是管制竞赛

Kimi K3模型以开源形态逼近闭源顶级水平,再次引爆中美AI竞赛的路线争论。相比技术本身,更值得关注的是美国可能通过制造合规风险来限制中国开源模型使用,而非直接禁止。AI应用的未来可能被地缘政治和监管策略重新定义。
Databricks估值1880亿,AI转型和成本控制的实战启示

Databricks通过内部测试发现,用中国开源模型GLM 5.2搭配开源harness Pi,编码成本比闭源方案低得多,效果却不差。这个案例告诉我们,AI成本控制不能只盯着模型,工具链的选择同样关键。
从图像集合推断视觉概念

视觉语言模型无法从少量示例图像中推理出共享概念,作者提出VICIS任务和训练框架,让模型学会提取概念嵌入,生成更准确多样的图像,甚至能泛化到未见概念和草图模态,推动AI从“听指令”转向“看例子”。
AI时代的记分卡:用「每美元有用智能」衡量AI价值

CFO不知道怎么衡量AI投入值不值?OpenAI提出“每美元有用智能”框架,从完成的工作量、成功任务成本、可靠性到规模效率四个维度落地评估。GPT-5.6家族用54%更少token达到SOTA,证明好模型能直接降本。读完你也能照这个思路给自己家AI算账。
AI如何利用深度上下文成为防御者的优势

防御者拥有关键的深度上下文优势,Google AI Threat Defense 框架将检测时间缩短 99.9%,摩根士丹利案例佐证了 AI 驱动的主动防御价值。