详细内容或原文请订阅后点击阅览
用于机器人政策培训和评估的交互式世界模拟器
假设您想教机器人将物体推到桌子上。机器人学习的标准方法是收集数百个真实机器人上的专家演示,根据这些数据训练模仿学习策略,然后通过在同一个真实机器人上多次运行该策略来评估该策略。两者都 [...]
来源:ΑΙhub假设您想教机器人将物体推到桌子上。机器人学习的标准方法是收集数百个真实机器人上的专家演示,根据这些数据训练模仿学习策略,然后通过在同一个真实机器人上多次运行该策略来评估该策略。这两个阶段(数据收集和评估)都是缓慢、昂贵且难以重现的:硬件故障、照明变化、物体偏离位置,而每一项新任务都意味着在实验室中花费更多时间。
一个自然的问题是我们是否可以用模拟器代替一些真实的机器人工作。基于经典物理的模拟器功能强大,但为新任务构建模拟器意味着手动建模几何形状、接触、摩擦和变形,并且生成的模拟器通常仍然与现实不够接近,无法在其中训练策略进行迁移。
在我们的工作中,我们走了不同的路线。我们构建了一个交互式世界模拟器:一个学习的、以动作为条件的视频预测模型,在给定当前图像和一系列机器人动作的情况下,纯粹在像素空间中预测下一帧,内部没有物理引擎。您可以插入远程操作设备并通过这个学习的世界模型在单个 RTX 4090 上以 15 FPS 控制机器人超过 10 分钟,并且预测的视频保持稳定且物理合理。
关键思想是,如果模拟器足够忠实,我们就可以解决机器人学习中两个长期存在的瓶颈:
– 用于训练的数据生成变得很便宜,因为我们可以在模拟器内收集演示。
– 策略评估变得可扩展和可重复,因为我们可以在相同的条件下通过模拟器滚动许多策略。
世界模拟器可以做什么模型捕获内容的一些示例:
杯子抓取:它捕捉细粒度的效果,例如杯子从夹具中滑出,或者手柄被轻推和旋转。
扫桩:可以一致生成多个视点的视频
