推理模型关键词检索结果

揭秘按策略蒸馏:它有帮助的地方、有伤害的地方以及原因

Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why

在策略蒸馏为训练推理模型提供密集的、按令牌的监督;然而,目前尚不清楚该信号在哪些条件下有益,在哪些条件下有害。应该采用哪种教师模式,在自我蒸馏的情况下,应该以哪种具体情境作为监督信号?不同代币的最佳选择是否有所不同?目前,解决这些问题通常需要昂贵的训练运行,其总体性能指标掩盖了单个代币级别的动态。我们推出了免培训...

自适应并行推理:高效推理扩展的下一个范例

Adaptive parallel reasoning: the next paradigm in efficient inference scaling

自适应并行推理概述。如果推理模型可以自行决定何时分解和并行化独立子任务、生成多少个并发线程以及如何根据当前问题协调它们,会怎样?我们对并行推理领域的最新进展进行了详细分析,特别是自适应并行推理。披露:这篇文章部分是景观调查,部分是自适应并行推理的视角。作者之一 (Tony Lian) 共同领导了 ThreadWeaver (Lian et al., 2025),这是下面讨论的方法之一。作者旨在以自己的方式呈现每种方法。 动机 除了数据和参数缩放之外,LLM 推理能力的最新进展很大程度上是由推理时间缩放驱动的(OpenAI 等人,2024 年;DeepSeek-AI 等人,2025 年)。显式输

NVIDIA Nemotron 3 Ultra 现已在 Amazon SageMaker JumpStart 上提供

NVIDIA Nemotron 3 Ultra now available on Amazon SageMaker JumpStart

在 Amazon SageMaker JumpStart 上部署 NVIDIA Nemotron 3 Ultra。借助此前沿推理模型,代理 AI 工作负载的推理速度提高 5 倍,成本降低 30%。