NVIDIA 开源 Cosmos 3 Edge:4B 参数的世界模型,跑在边缘设备上

物理 AI 落地边缘设备时,最大的痛点是模型太大跑不动,或者跑得慢到没法用。一个仓库里的机器人如果花几秒钟才能想明白要不要抓箱子,那它就是个摆设。NVIDIA 这次推出的 Cosmos 3 Edge 直击的就是这个矛盾——4B 参数的开放模型,要在内存受限的 Jetson 这类边缘芯片上,实现数据中心级别的实时推理和动作生成。它不光要看得懂场景,还得在几毫秒内给出下一个动作指令,不然就毫无价值。

解法上,最聪明的是它的双 Transformer 架构。一个自回归塔负责理解和推理(看画面、读指令),一个扩散塔负责预测和生成(模拟未来画面、输出动作),中间靠共享的多模态注意力层对齐信息。动作被统一编码成紧凑的几何向量,包含位移、旋转和抓取状态,这样不管你是轮式机器人还是机械臂,映射都变得简单。在 NVIDIA Jetson Thor 上,它一次推理能生成 32 个动作,跑在 15Hz 的实时控制频率上,这速度才是工业场景真正能用的。开发者可以从 Hugging Face 直接下载模型,用小规模的 H100 集群微调,再部署到边缘。

我的看法是,NVIDIA 这次押注的点很准:把世界模型做小、做快,直接放到传感器的旁边,而不是依赖云端。未来物理 AI 的价值不在数据中心里,而在产线、仓库和医院走廊上。Cosmos 3 Edge 作为开放基础模型平台,给了开发者一个低门槛的起点,让自定义机器人策略和数据蒸馏变得更实际。如果你在搞工业视觉或机器人控制,这个模型值得拿来试试,它可能会让边缘端的实时推理不再是一个玄学。

Introducing Cosmos 3 Edge

查看原文