iFeeling Daily
每天精选值得关注的 AI 动态
开源追赶闭源的循环赛

开源模型没必要领跑,只要能把闭源模型的利润空间压缩 90%,就能把整个市场卷得更快。这不是一场谁赢的比赛,而是一个互相加速的飞轮:闭源做创新,开源做商品化。
NVIDIA 开源 Cosmos 3 Edge:4B 参数的世界模型,跑在边缘设备上

NVIDIA 开源了一个 4B 参数的世界模型 Cosmos 3 Edge,专门为 Jetson 等边缘设备设计。它用双 Transformer 架构同时做实时推理和动作生成,在机器人控制分辨率下跑到了 15Hz。对搞物理 AI 应用的人来说,这意味着不用再为模型太大发愁了。
RayRoPE:让多视角Transformer真正理解3D几何的位置编码方案

多视角Transformer的核心痛点:传统编码要么认像素坐标,要么认光线方向,但都丢了真实3D几何关系。RayRoPE用一个巧妙思路——把预测的3D点投影到查询帧做编码,再算不确定性,结果LPIPS直接提了15%,结构很优雅,实用性极强。
Kimi K3引发的开源AI恐慌背后是管制竞赛

Kimi K3模型以开源形态逼近闭源顶级水平,再次引爆中美AI竞赛的路线争论。相比技术本身,更值得关注的是美国可能通过制造合规风险来限制中国开源模型使用,而非直接禁止。AI应用的未来可能被地缘政治和监管策略重新定义。
Databricks估值1880亿,AI转型和成本控制的实战启示

Databricks通过内部测试发现,用中国开源模型GLM 5.2搭配开源harness Pi,编码成本比闭源方案低得多,效果却不差。这个案例告诉我们,AI成本控制不能只盯着模型,工具链的选择同样关键。
从图像集合推断视觉概念

视觉语言模型无法从少量示例图像中推理出共享概念,作者提出VICIS任务和训练框架,让模型学会提取概念嵌入,生成更准确多样的图像,甚至能泛化到未见概念和草图模态,推动AI从“听指令”转向“看例子”。
NVIDIA 与 Hugging Face 联手:大规模微调图像与视频扩散模型

NVIDIA 和 Hugging Face 联手,让你微调 FLUX、Wan 这类模型时不用再重写分布式训练代码。NeMo Automodel 把 FSDP2、Tensor Parallel 等并行策略变成了配置文件里的几个开关,从8张卡到数百张卡,脚本一行不改。8卡 H100 上跑 FLUX 全参数微调,每步不到1秒。
新模型,老优势

多语言大模型做OCR看起来很强大,但在巴西葡萄牙语这类细分语言上,一个专注的专用模型能轻松碾压更新、更重的通用模型。这篇博客用真实数据和具体失败案例告诉你:资源聚焦比规模更重要,而且这个逻辑不会因为模型进步而改变。
CLaRa:用连续潜在推理桥接检索与生成

RAG模型又慢又割裂?CLaRa直接把文档压缩成连续向量,用可微top-k让检索器和生成器端到端一起训练。16倍压缩后效果反而更好,这种路子可能让我们不再需要硬塞超长上下文。