详细内容或原文请订阅后点击阅览
超越下一个标记预测:扩散与自回归语言模型的性能表征
大型语言模型 (LLM) 在广泛的自然语言处理 (NLP) 任务(包括文档处理和代码生成)上取得了最先进的性能。自回归语言模型(ARM)根据所有先前的标记顺序生成标记,一直是法学硕士的主要范例。虽然这些模型在一系列下游任务中实现了高精度,但由于下一个令牌预测中固有的顺序依赖性,它们表现出较低的算术强度。最近,扩散语言模型 (DLM) 已成为一种有前途的......
来源:Apple机器学习研究大型语言模型 (LLM) 在广泛的自然语言处理 (NLP) 任务(包括文档处理和代码生成)上取得了最先进的性能。自回归语言模型(ARM)根据所有先前的标记顺序生成标记,一直是法学硕士的主要范例。虽然这些模型在一系列下游任务中实现了高精度,但由于下一个令牌预测中固有的顺序依赖性,它们表现出较低的算术强度。最近,扩散语言模型 (DLM) 已成为一种有前途的替代架构。 DLM 并行生成输出令牌,从而减轻顺序解码的限制。然而,DLM 相对于常用部署的 ARM 的性能影响尚不完全清楚。在这项工作中,我们对 ARM 和 DLM 的性能特征进行了全面研究,将理论分析与实证分析相结合,以描述这些方法之间的权衡。我们表明,尽管 DLM 通过利用代币位置之间的并行性可以实现比 ARM 更高的算术强度,但它们无法在更长的上下文中有效扩展。然后,我们探索 DLM 的分块解码,它将算术强度与序列长度解耦,并能够更好地扩展到长上下文(类似于 ARM)。我们还检查了批处理推理,发现 ARM 表现出卓越的吞吐量,因为它们从批处理中跨序列的并行性中获益更多。最后,我们强调加速 DLM 推理的机会,强调减少采样步骤数量是开源 DLM 实现相对于 ARM 更低延迟的关键。
