详细内容或原文请订阅后点击阅览
缩放分类流程图
None
来源:Apple机器学习研究连续扩散和流匹配模型可以代表语言建模 (LM) 自回归方法的强大替代方案,因为它们释放了当前为连续模态保留的许多优势,包括加速采样和倾斜。最近,一些工作已经证明了通过高斯分布和单热编码数据分布之间的简单流匹配过程连续生成离散数据的可能性。他们进一步证明了通过分类流图(CFM)加速采样的可行性,从而在几个步骤的情况下获得具有竞争力的样本质量。然而,该方法仅在相对适度的规模(< 1B)下进行了评估,其可扩展性问题完全悬而未决。在本文中,我们在 2.1T 令牌上训练 1.7B 参数基本流模型,并将其自蒸馏为 CFM,该 CFM 只需 4 个推理步骤即可生成多样化的高质量文本,同时保持接近数据级别的令牌熵。此外,我们在半离散设置中引入了 CFM 的似然界限,并表明它们可用于在标准 LM 基准上对模型进行评分,从而获得与离散扩散方法相同范围内的结果。最后,我们揭示了大规模训练这些模型所带来的一些挑战,并提供了有关损失权重和时间安排的规范性见解。
