自回归关键词检索结果

超越下一个标记预测:扩散与自回归语言模型的性能表征

Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

大型语言模型 (LLM) 在广泛的自然语言处理 (NLP) 任务(包括文档处理和代码生成)上取得了最先进的性能。自回归语言模型(ARM)根据所有先前的标记顺序生成标记,一直是法学硕士的主要范例。虽然这些模型在一系列下游任务中实现了高精度,但由于下一个令牌预测中固有的顺序依赖性,它们表现出较低的算术强度。最近,扩散语言模型 (DLM) 已成为一种有前途的......

Britten-Norman开始对首架自英国回归后制造的Islander进行地面测试

Britten-Norman begins ground testing of first Islander built since UK homecoming

Britten-Norman开始对自回归英国以来首架在英国制造的Islander飞机进行地面测试

CPU上的推测解码:DFlash实现近4倍令牌生成加速

Speculative Decoding on CPUs: Nearly 4x Faster Token Generation with DFlash

推测性解码可以将未充分利用的 CPU 计算转化为更快的令牌生成,而无需更改模型的输出。在我们的 vLLM 测试中,DFlash 在并发数为 1 时在 Intel Xeon 6 上使用 Qwen3.5-9B 实现了 3.92 倍的自回归吞吐量。我们详细分析了加速的来源,解释了接受指标,并展示了决定推测是否有效的因素。CPU 上的推测解码:使用 DFlash 使令牌生成速度加快近 4 倍首先出现在《走向数据科学》上。

长度价值模型:令牌级长度建模的可扩展价值预训练

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

Token作为现代自回归模型的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有方法缺乏细粒度的长度建模,主要在粗粒度的序列级别上运行。在本文中,我们介绍了长度值模型(LenVM),这是一个令牌级框架,用于对每个解码步骤的剩余生成长度进行建模。通过将长度建模表述为价值估计问题,并为每个生成的代币分配恒定的负奖励,LenVM…