REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
当前大多数视觉-语言-动作 (VLA) 模型(例如 OpenVLA、π0、RT-2 和 RDT-1B)都是“单一的”。这意味着它们生成原始运动命令或非常短的动作序列,而不将行为组织成可重用的、定义明确的抽象。因此,这些模型在长期(多步骤)任务上表现不佳,并且很难解释它们学到的东西。现有的发现技能的方法通常避免了决定两个动作序列何时“行为等效”的核心问题。例如,AtomicVLA 和 AtomSkill 通过...分组动作序列