详细内容或原文请订阅后点击阅览
套利:通过优势感知投机进行有效推理
Error 500 (Server Error)!!1500.That’s an error.There was an error. Please try again later.That’s all we know.
来源:Apple机器学习研究现代大型语言模型通过长思想链实现了令人印象深刻的推理能力,但在推理过程中会产生大量的计算成本,这激励了技术提高性能成本比。在这些技术中,推测解码通过采用快速但不准确的草稿模型来自动回归地提出令牌,然后由功能更强大的目标模型并行验证令牌,从而加速推理。然而,由于语义等效步骤中令牌不匹配导致不必要的拒绝,传统令牌级推测解码在推理任务中陷入困境。尽管最近的工作已经转向步骤级语义验证,通过接受或拒绝整个推理步骤来提高效率,但现有的步骤级方法仍然重新生成许多被拒绝的步骤,几乎没有改进,浪费了宝贵的目标计算。为了应对这一挑战,我们提出了 ARBITRAGE,这是一种新颖的阶梯级投机生成框架,可根据草稿模型和目标模型之间的相对优势动态地路由生成。 ARBITRAGE 没有应用固定的接受阈值,而是使用经过训练的轻量级路由器来预测目标模型何时可能产生有意义的更好步骤。这种路由近似于理想的套利预言机,它始终选择更高质量的步骤,实现接近最优的效率与准确性权衡。在多个数学推理基准中,ARBITRAGE 始终超越先前的步级 SD 基线,在匹配的精度下将推理延迟减少高达 ∼ 2 倍。
