REFACTOR-VLA:无监督学习可复用的类型化动作程序

当前主流的视觉-语言-动作模型(VLA),例如 OpenVLA、π0、RT-2、RDT-1B,本质上是“单体式”的。它们直接生成原始的马达指令或极短的动作序列,缺乏将行为组织为可复用、有清晰定义的动作模块的能力。这使得它们在处理需要多步操作的长周期任务时表现不佳,并且模型习得的内容难以解释。

现有的一些技能学习方法回避了核心难题:如何判断两段动作序列在行为上是否等价。例如,AtomicVLA 和 AtomSkill 通过对对比学习的嵌入进行聚类来分组动作序列;而 BLADE 和 LRLL 则依赖大语言模型来判断序列等价性,但 LLM 并不了解机器人自身的动力学特性。

REFACTOR-VLA 提出了一套新方案。它采用“睡眠/觉醒”架构来学习可复用的技能。在“睡眠”阶段,系统利用一个基于行为等价核的函数,对动作程序片段进行聚类。这个等价核的核心机制,是在一个学到的潜在世界模型 Mφ 中,执行动作并观察结果,以此判定两个动作序列是否等效。在“觉醒”阶段,系统从一个受 Hindley-Milner 类型系统启发的词汇表中,生成带有类型的 lambda 项(一种结构化的程序)。这些 lambda 项随后被送入一个基于技能库的条件化流式动作解码器来生成实际动作。只有同时通过最小描述长度准则和回报保留门控的条件,该技能才会被加入到库中。

训练过程分为三个阶段:阶段 A 预热世界模型;阶段 B 通过强化学习优化使用技能库的策略;阶段 C 则将动作片段聚类为可复用的技能。

实验在完整的 LIBERO 基准套件上进行。结果有两个关键发现:第一,单纯将世界模型的参数量从 1.88 亿扩大到 4.3 亿,反而导致了全部 4 个测试套件上的性能下降——证明“模型越大越好”的假设不成立。第二,改变训练目标作用显著:在世世界模型预热阶段(Phase A)加入辅助的监督对比损失(即 InfoNCE 损失),能极大提升睡眠阶段(Phase C)技能聚类的质量。在 n=3 的多重随机初始化条件下,聚类结果的归一化互信息评分如下:Object 套件 0.462 ± 0.021;Spatial 套件 0.867 ± 0.025;Goal 套件 0.915 ± 0.013;LIBERO-10 套件 0.754 ± 0.010。

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

查看原文