NVIDIA Nemotron 3.5 Lightning 现已在 Amazon SageMaker JumpStart 中提供

NVIDIA Nemotron 3.5 Lightning 是一种专为大容量代理工作负载而构建的开放模型,现已在 Amazon SageMaker JumpStart 中提供。本文介绍了如何部署 30B 专家混合模型(3B 主动),该模型可为始终在线的代理提供高达 4 倍的吞吐量和高达 30% 的任务完成速度。

来源:亚马逊云科技 _机器学习

NVIDIA Nemotron 3.5 Lightning 专为大容量代理工作负载所需的快速、专业模型执行而设计。借助 Amazon SageMaker JumpStart 上的 NVIDIA Nemotron 3.5 Lightning,您可以访问专为大容量代理工作负载而设计的开放模型。

通过此次发布,您可以从 Amazon SageMaker JumpStart 部署 Nemotron 3.5 Lightning,而无需自行配置服务基础设施。 NVIDIA 将 Lightning 描述为同类产品中速度最快的开放模型,可为始终在线的代理提供支持。它可将大容量代理工作负载的吞吐量提高多达 4 倍,并将任务完成速度提高多达 30%。总参数为 30B,仅 3B 活动,它可以在单个受支持的 GPU 上运行。因此,代理工作流程中的重复、专门步骤可以在没有前沿规模基础设施的情况下运行。在这篇文章中,我们向您展示如何从 SageMaker JumpStart 部署 Nemotron 3.5 Lightning。

NVIDIA Nemotron 3.5 Lightning 概述

Nemotron 3.5 Lightning 是一款公开的基础模型,源自 NVIDIA 的前沿 Nemotron 3 Ultra,并与 Nemotron 联盟共同开发。它使用混合专家混合 (MoE) 架构,并专门针对跨流行代理工具使用代理工具进行了培训。它在开放数据集上进行训练并作为开放模型发布,因此您可以对其进行自定义,拥有生成的权重,并将其部署在您的代理运行的任何地方。

下表总结了 NVIDIA Nemotron 3.5 Lightning 的主要规格和性能特征。

并非每个代理步骤都需要前沿模型

在许多情况下,通过单个大型模型运行所有模型支持的步骤可能会增加较小的专用模型可以处理的前沿模型成本和延迟。模型系统方法可以将每个步骤路由到适合该任务的模型。

推理和代理基准的准确性

下表比较了 Nemotron 3.5 Lightning 的 BF16 和 NVFP4 变体的关键推理和代理基准。

企业用例