详细内容或原文请订阅后点击阅览
物理人工智能的未来不是更智能的机器人,而是更智能的界面
这篇赞助文章由 Wetour Robotics 为您带来。风力涡轮机上的现场技术人员,夹住安全带,双手握住扳手,需要向挂在腰带上的诊断设备发送命令。装卸码头上的一名物流工人戴着手套,眼睛盯着托盘,需要重新调整连接的电梯的方向。在拥挤的街道上使用辅助移动设备的人希望在不拿出手机或大声说话的情况下推动它前进。这些时刻都不需要更智能的机器人。他们呼吁采用一种更智能的方式来让现有的机器听到声音。该行业一直在从一方面进行建设。过去三年的物理人工智能是循环中机器人方面取得显着进展的故事。 Boston Dynamics、Figure 和 Unitree 等公司拥有先进的执行器、运动和灵巧性,其水平在十年前似乎难以置信。谷歌 DeepMind 的 Gemini Robotics 重新定义了视觉-语言-动作模型在非结构化环境中的功能。硬件和基础模型的轨迹是真实的,而且正在加速。但这个循环还有另一面,长期以来它一直被视为已解决的问题。 40 年来,人与机器之间的界面默认采用三种输入方式:屏幕、按钮和语音。其中每一个都假设用户可以停下来、向下看并将意图转换为结构化命令。当工作进入真实环境时,这种假设就被打破了。在涡轮上
来源:IEEE Spectrum _机器人这篇赞助文章由Wetour Robotics 为您带来。
风力涡轮机上的现场技术人员,背带被夹住,双手握着扳手,需要向挂在腰带上的诊断设备发送命令。装卸码头上的一名物流工人戴着手套,眼睛盯着托盘,需要重新调整连接的电梯的方向。在拥挤的街道上使用辅助移动设备的人希望在不拿出手机或大声说话的情况下推动它前进。这些时刻都不需要更智能的机器人。他们呼吁采用更智能的方式让现有机器听到声音。
该行业一直在从一侧开始构建
过去三年,物理人工智能在机器人方面取得了显着进展。 Boston Dynamics、Figure 和 Unitree 等公司拥有先进的执行器、运动和灵巧性,其水平在十年前似乎难以置信。谷歌 DeepMind 的 Gemini Robotics 重新定义了视觉-语言-动作模型在非结构化环境中的功能。硬件和基础模型的发展轨迹是真实的,而且正在加速。
但这个循环还有另一面,并且长期以来它一直被视为已解决的问题。 40 年来,人与机器之间的界面默认采用三种输入方式:屏幕、按钮和语音。其中每一个都假设用户可以停下来、向下看并将意图转换为结构化命令。当工作进入真实环境时,这种假设就被打破了。在涡轮机上。在码头上。在人行道上。在任何双手被占用、眼睛被占用或说话不切实际的环境中,传统的界面堆栈都会悄然失效。
空间意图融合是同时处理以人为中心的三个信息流,即空间位置、视觉上下文和手势意图:您的身体就是界面。
Wetour Robotics 的赌注:让人类重新回到计算循环
架构:三层、四个引擎、一个循环
Wetour 机器人
