详细内容或原文请订阅后点击阅览
通过 DSpark 推测解码加速 LLM 推理
了解 DSpark 推测解码如何使用相同的 GPU、Qwen3-8B、llama.cpp 和 CUDA 来提高本地 LLM 生成速度。
来源:KDnuggets有很多方法可以从您已有的模型和 GPU 基础设施中获得更多收益。量化、优化内核和更好的推理引擎都有帮助,但推测解码尤其有用,因为它可以提高生成速度,而无需简单地添加更多 GPU。
现在有几种推测解码方法。传统方法使用较小的草稿模型,而多令牌预测 (MTP) 可以同时预测多个未来令牌。 Medusa 和 EAGLE 等方法改进了这些草稿的生成方式,而 DFlash 则并行生成候选代币块。
DSpark 采用了另一种方法,将并行绘图与轻量级顺序组件相结合。这有助于后来的草稿令牌使用来自早期预测的信息,同时保持并行生成的大部分速度优势。
在本指南中,我们将使用 Qwen3-8B 和 llama.cpp 测试 DSpark。我们将正常对模型进行基准测试,使用匹配的草稿模型启用 DSpark,并比较生成速度,看看我们可以从相同的 GPU 中获得多少性能。
DSpark 的工作原理
DeepSeek 的 DSpark 改进了推测解码的起草部分。
并行草稿模型可以一次性预测整个令牌块,速度很快,但后来的预测可能会变得不太准确,因为它们不完全依赖于块中先前预测的令牌。 DSpark 将并行主干与轻量级顺序组件相结合,允许稍后的选秀位置合并来自早期预测令牌的信息,同时保留大部分并行生成的速度。
简单来说:
DSpark 还可以估计草案代币通过验证的可能性有多大,从而允许丢弃区块的低置信度部分,而不是浪费验证。compute.llama.cpp 通过其 DSpark 实现和可选的置信度阈值公开了这一点。
1. 构建 llama.cpp 并下载模型
安装所需的工具:
克隆官方 llama.cpp 存储库:
