Claude在机器人任务上的表现评测

语言模型在文本和代码上很强,但一碰到需要精确3D理解、物理动力学和实时控制的机器人任务,就暴露了根本性短板。这篇文章的核心发现是:模型能不能让机器人动起来,几乎完全取决于你用什么接口把它连上机器人。直接让模型去算每个关节的扭矩——它基本全废;但如果你给它一个预训练好的步态策略或视觉-语言-动作(VLA)模型,让它当“监督者”去指导这个策略,它就能完成导航、抓取这些真实世界任务。问题是,这种能力分布极不均匀:新模型在高层控制上进步明显,但低层直接控制依然惨淡,在复杂人形机器人上甚至无法完成一次站立。

为了搞清楚究竟什么在起作用,作者设计了一套从经典控制玩具到真实Unitree Go2四足机器人的完整测试,用了四种控制接口:直接输出扭矩、写Python控制器、监督预训练策略、以及从零训练强化学习策略。结果非常清晰:高层抽象接口是让模型“破圈”的关键。当模型通过预训练步态策略控制四足机器人时,能完成“找到蓝色X”等导航任务,但一旦需要持续的空间记忆或开环规划(比如记住走过多长的走廊),就立刻失败。在机械臂操作上,预训练的VLA策略把成功率从直接控制的0-5.5%抬升到可观水平,但新模型也展现了“过度干预”的毛病——Mythos Preview因为太爱修改VLA的建议,反而比全盘照做的Opus 4.5表现更差。视觉感知是明确的瓶颈:一个简单的指南针工具(告诉模型朝向)比任何视觉增强(深度图、第三视角)都有效,而光标工具(可移动的红点)让操作成功率从6%飙到32%。

这篇研究对任何想用语言模型操控物理世界的人都有直接启示。当前前沿模型已经能通过“指导+监督”的方式完成有限但有意义的物理动作,但安全风险同样真实:模型会因为玻璃反射看到目标就径直撞向玻璃门,或因为视觉幻觉把垃圾桶当成安全路径。这意味着,评估模型能力时必须把“控制接口”和“感知工具”当作系统核心部分,而不是模型本身的属性。未来的方向很明确:继续提升模型从图像中提取空间信息的能力(新模型已经比老模型强很多),同时开发更聪明的监督策略——知道什么时候该相信预训练策略,什么时候该纠正它。但最底层的直接控制能力提升依然缓慢,这意味着在可预见的未来,任何真实的物理部署都必须依赖“模型+预训练策略”的混合架构,并配以严格的物理安全边界。

How Claude Performs on Robotics Tasks

查看原文