MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization
为了在不同的环境中有效运行,机器人不仅必须准确地执行操作任务,而且还要根据任务、对象和交互设置调整其行为的展开方式。我们询问这种执行级别的变化是否可以作为跨任务共享的可重用行为因素来学习。我们提出了 MoMo,一个两阶段的模仿学习框架,由时空动作标记器和行为克隆转换器组成,该转换器将任务和连续运动模式条件作为输入。在六个真实的机器人操作任务中,改变这种条件会产生稳定的……
Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
Siri Expressive Voices 完全在设备上实时合成丰富、可配置的语音,由 Apple 最强大的设备基础模型 AFM 3 Core Advanced 提供支持。这项工作展示了该功能背后的内存高效音频合成架构:一个去标记器,可在 Apple 矩阵协处理器 (AMX) 紧张的计算和内存预算内将基础模型发出的语义音频标记转换为高保真音频。我们使用三组件设计(流式传输)将语义音频标记转换为残差矢量量化(RVQ)表示形式……
VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization
视觉分词器将高维原始像素映射为下游建模的压缩表示。除了压缩之外,标记器还决定保留哪些信息以及如何组织信息。视频标记化事实上的标准方法是将视频表示为标记的时空 3D 网格,每个标记捕获原始信号中相应的局部信息。这需要使用令牌的下游模型(例如文本到视频模型)学习“逐像素”预测所有低级细节,而不考虑视频固有的复杂性,从而导致......