详细内容或原文请订阅后点击阅览
REFACTOR-VLA:类型化运动程序的无监督库学习
当前大多数视觉-语言-动作 (VLA) 模型(例如 OpenVLA、π0、RT-2 和 RDT-1B)都是“单一的”。这意味着它们生成原始运动命令或非常短的动作序列,而不将行为组织成可重用的、定义明确的抽象。因此,这些模型在长期(多步骤)任务上表现不佳,并且很难解释它们学到的东西。现有的发现技能的方法通常避免了决定两个动作序列何时“行为等效”的核心问题。例如,AtomicVLA 和 AtomSkill 通过...分组动作序列
来源:Apple机器学习研究当前大多数视觉-语言-动作 (VLA) 模型(例如 OpenVLA、π0、RT-2 和 RDT-1B)都是“单一的”。这意味着它们生成原始运动命令或非常短的动作序列,而不将行为组织成可重用的、定义明确的抽象。因此,这些模型在长期(多步骤)任务上表现不佳,并且很难解释它们学到的东西。现有的发现技能的方法通常避免了决定两个动作序列何时“行为等效”的核心问题。例如,AtomicVLA 和 AtomSkill 通过对对比嵌入进行聚类来对动作序列进行分组。相比之下,BLADE 和 LRLL 依靠大型语言模型(LLM)来判断两个序列是否等效,但这些 LLM 并未根据机器人自身的动力学进行校准。我们引入了 REFACTOR-VLA,这是一个使用“唤醒/睡眠”架构学习可重用技能的系统。在睡眠阶段,系统使用行为等效内核(BEK)对运动程序片段进行聚类。该 BEK 基于在学习的潜在世界模型 Mφ 中推出操作的结果。在唤醒阶段,系统根据受 Hindley-Milner 类型系统启发的词汇生成类型化 lambda 术语(简单的结构化程序)。然后,库条件整流流动作解码器使用这些 lambda 项来生成动作。只有同时通过最小描述长度 (MDL) 标准和返回保存门的抽象才被接受为技能。为了训练 REFACTOR-VLA,我们使用三阶段计划: • 阶段 A(世界模型预热):训练潜在世界模型 Mφ。 • 阶段B(唤醒阶段策略优化):优化使用技能库的策略。 • 阶段C(睡眠阶段技能发现):系统将动作片段聚集成可重复使用的技能。我们在完整的 LIBERO 基准套件上评估了 REFACTOR-VLA。我们的结果显示了两个主要发现。首先,简单地增加世界模型的规模——从 1.88 亿吨开始
