使用解耦时间深度扩散变压器进行内存高效音频合成

Siri Expressive Voices 完全在设备上实时合成丰富、可配置的语音,由 Apple 最强大的设备基础模型 AFM 3 Core Advanced 提供支持。这项工作展示了该功能背后的内存高效音频合成架构:一个去标记器,可在 Apple 矩阵协处理器 (AMX) 紧张的计算和内存预算内将基础模型发出的语义音频标记转换为高保真音频。我们使用三组件设计(流式传输)将语义音频标记转换为残差矢量量化(RVQ)表示形式……

来源:Apple机器学习研究

Siri Expressive Voices 完全在设备上实时合成丰富、可配置的语音,由 Apple 最强大的设备基础模型 AFM 3 Core Advanced 提供支持。这项工作展示了该功能背后的内存高效音频合成架构:一个去标记器,可在 Apple 矩阵协处理器 (AMX) 紧张的计算和内存预算内将基础模型发出的语义音频标记转换为高保真音频。我们通过三组件设计(流编码器、时间解码器和深度解码器)将语义音频标记转换为残差矢量量化(RVQ)表示,系统地解耦时间和深度处理。具有扩散变压器 (DiT) 式阶段条件的单个可重用深度解码器可自回归生成所有 RVQ 级别,取代了先前多解码器架构的专用每级解码器,而具有固定窗口键值缓存的因果滑动窗口注意可产生与序列长度无关的恒定内存复杂性。部署在 AMX 上的 detokenizer 每生成步骤维持约 10 毫秒(比实时速度快约 16 倍),峰值运行时内存仅为 ∼21MB 和 329MB 设备上资源,能够与设备上基础模型一起连续流式合成 20-320 秒的音频。这种恒定的小占用空间取代了传统 Transformer 和 GAN 方法的线性和二次内存扩展。全面的消融研究验证了关键架构组件的有效性,包括 DiT 调节机制、时间前瞻处理和统一深度解码策略。通过语音辨别性分析、感知质量指标和神经质量估计进行的音频质量评估证实,所提出的架构保持了合成保真度,同时实现了比现有方法更高的计算效率。所提出的架构部署在 p