
MolmoMotion:用语言指导的3D运动预测模型

大部分AI都停留在“看懂了已发生的事”,但真正有用的系统需要“预判接下来会发生什么”。一个机器人要抓杯子,得在接触之前就预测杯子会怎么动;一个视频生成器要生成下一帧,得先知道什么是合理的物理运动。感知的局限性就在这里——它永远在回顾过去。MolmoMotion就是冲着这个问题去的:给你一张图、标几个3D点加一句文字指令,它能预测出这些点在接下来几秒里在真实3D空间中的运动轨迹,精度远超现有方法。配套还发布了目前最大的配文3D轨迹数据集和人工校验的评测基准,让这事从能跑到能测都有了基础。
它的核心思路很聪明:用附着在物体上的稀疏3D点作为运动表示。这种方式不依赖任何预设的物体类别模板(手、身体、刚性物体都不需要),而且因为是世界坐标系下的点,换摄像头换视角轨迹依然稳定。关键是,这些点轨迹可以直接喂给下游的机器人策略或视频生成模型,不需要额外转换。模型本身基于Molmo 2,能理解语言指令和图像中的对应关系,然后做了两个变体:MolmoMotion-AR用自回归方式一步步吐出未来坐标,准确度最高;MolmoMotion-FM用流匹配在连续空间里预测,能处理指令有歧义时多种可能的运动轨迹。数据方面,他们从海量互联网视频里自动提取3D轨迹并配对动作描述,用了一堆滤波和裁剪技巧清洗噪声,最终产出百万级的高质量数据。
最有意思的是MolmoMotion展现出的迁移能力。在机器人规划任务上,基于它的控制策略在仿真环境里成功率76.3%,碾压同样基于Molmo 2的56%,而且学习速度快得多——10K步就达到51%,对比基线最好才19%。在真实机器人上,它用约2K步就追平了基线12K步的误差。这背后的逻辑很本质:物体在3D空间中的运动规律是共通的,不管是被人手拎还是被机械臂抓,杯子的路径本质上一样。MolmoMotion学到的是这种底层运动物理,而不是特定场景的表面模式。用它引导视频生成也让小物体和精细运动的生成质量显著提升,在5项运动指标上全面超越基础模型。这套思路告诉我们:预测不是感知的附属品,而是一个独立的、同样基础的智能能力,而且可以从视频中大规模学到并泛化到不同场景。


