详细内容或原文请订阅后点击阅览
长度价值模型:令牌级长度建模的可扩展价值预训练
Token作为现代自回归模型的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有方法缺乏细粒度的长度建模,主要在粗粒度的序列级别上运行。在本文中,我们介绍了长度值模型(LenVM),这是一个令牌级框架,用于对每个解码步骤的剩余生成长度进行建模。通过将长度建模表述为价值估计问题,并为每个生成的代币分配恒定的负奖励,LenVM…
来源:Apple机器学习研究Token作为现代自回归模型的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有方法缺乏细粒度的长度建模,主要在粗粒度的序列级别上运行。在本文中,我们介绍了长度值模型(LenVM),这是一个令牌级框架,用于对每个解码步骤的剩余生成长度进行建模。通过将长度建模制定为价值估计问题,并为每个生成的代币分配恒定的负奖励,LenVM 预测有界的贴现回报,该回报充当剩余生成范围的单调代理。这种表述产生了无注释、密集、无偏见和可扩展的监督。 LLM 和 VLM 上的实验表明,LenVM 在推理时提供了高效的信号。在 LIFEBench 精确长度匹配任务上,将 LenVM 应用于 7B 模型,将长度得分从 30.9 提高到 64.8,显着优于前沿闭源模型。此外,LenVM 能够持续控制性能和效率之间的权衡。在 GSM8K 上,预算为 200 个令牌时,LenVM 保持了 63% 的准确度,而令牌预算基准的准确度为 6%。它还可以准确预测从提示边界开始的总生成长度。最后,LenVM 的代币级值提供了生成动态的可解释视图,揭示了特定代币如何将推理转向更短或更长的机制。结果表明,LenVM 支持广泛的应用,包括长度控制、预测和发电动态解释。他们建议,生成长度可以有效地建模为令牌级值信号,突出了 LenVM 作为长度建模通用框架和作为可以支持未来 RL 训练的特定长度值信号的潜力。
