NVIDIA发布Cosmos 3:首个物理AI全能世界基础模型
物理AI领域长期存在一个痛点:开发者需要在多个专用模型之间切换——生成模型、推理模型、策略模型各自独立,每次切换都意味着重新配置推理管线。Cosmos 3用**Mixture-of-Transformers(MoT)架构**一次性解决了这个问题:它是一个真正的omni-model,在单一前向传播中同时完成世界生成、物理推理和动作预测。模型通过专用编码器(ViT处理视觉、VAE处理音视频生成、domain-aware向量处理动作)将所有模态映射到共享表示空间,然后在AR子序列做推理理解,在DM子序列做生成去噪。
这次发布的两个版本定位清晰:Cosmos 3 Nano是**8B参数模型**,优化为高效推理设计,能在RTX PRO 6000这样的工作站级GPU上运行;Cosmos 3 Super是**32B参数模型**,面向大规模合成数据生成和科研场景,需要Hopper或Blackwell GPU。两个模型都已上线Hugging Face,并提供了与Diffusers库的深度集成,开发者用几行代码就能跑通pipeline。
值得注意的信号是NVIDIA在推Cosmos 3时重点强调了合成数据生成(SDG)数据集的配套发布。这说明他们真正想解决的不是“让单个模型更强”,而是**为整个物理AI社区提供可复用的训练和评测基准**。对于机器人、自动驾驶、智能仓储这些领域来说,高质量的训练数据获取成本极高,Cosmos 3如果能成为这个生态的数据底座,价值会远超模型本身。


