30B关键词检索结果

MCTP 3-30B

MCTP 3-30B

信息知识管理

极其简单的自蒸馏改进了代码生成

Embarrassingly Simple Self-Distillation Improves Code Generation

大型语言模型 (LLM) 能否在没有验证器、教师模型或强化学习的情况下仅使用其自己的原始输出来改进代码生成?我们通过简单自蒸馏(SSD)给出肯定的答案:从具有特定温度和截断配置的模型中抽取样本解决方案,然后使用标准监督微调对这些样本进行微调。 SSD 在 LiveCodeBench v6 上将 Qwen3-30B-Instruct 从 42.4% 提高到 55.3% pa​​ss@1,收益主要集中在更难的问题上,并且它在 4B、8B 和 30B 规模的 Qwen 和 Llama 模型上进行了推广,包括......

在 AWS GovCloud(美国)的 Amazon Bedrock 上运行 NVIDIA Nemotron 和 OpenAI GPT OSS 模型

Run NVIDIA Nemotron and OpenAI GPT OSS models on Amazon Bedrock in AWS GovCloud (US)

我们很高兴在 AWS GovCloud(美国)中引入基于美国的前沿开放权重模型。通过此版本,Amazon Bedrock 现在支持 OpenAI 的开放权重 GPT OSS 模型(120B 和 20B)和 NVIDIA Nemotron(Nano 9B v2、Nano 12B v2、Nano 30B、Super 120B)模型。在这篇文章中,我们将介绍这些模型及其功能、数据驻留的推理选项、可用的服务层以及如何开始。