详细内容或原文请订阅后点击阅览
在 Amazon SageMaker HyperPod 和 Amazon EKS 上部署 Kimi K3
本文将介绍如何使用两种方法在 AWS 上部署 Kimi K3:Amazon SageMaker HyperPod 和 Amazon Elastic Kubernetes Service (Amazon EKS) 集群。
来源:亚马逊云科技 _机器学习开放权重模型已经变得足够强大,可以处理复杂的任务,例如多步骤代理工作流程、高级推理和长期编码。然而,随着这些模型能力的增长,它们的规模也随之增长,并且托管数万亿参数架构需要专门构建的基础设施、高端 GPU 计算和优化的服务框架。 2026 年 7 月 27 日,Moonshot AI 发布了 Kimi K3,这是一个 2.8 万亿参数的专家混合 (MoE) 模型,代表第一个达到 3 万亿参数类别的开放权重系统。 Kimi K3 提供前沿级情报,同时公开其权重,以便组织可以在自己的基础设施上自行托管现有最强大的模型之一。
本文将介绍如何使用两种方法在 AWS 上部署 Kimi K3:Amazon SageMaker HyperPod 和 Amazon Elastic Kubernetes Service (Amazon EKS) 集群。
关于Kimi K3
Kimi K3 基于差异化架构构建,具有 Kimi Delta Attention (KDA)、Gated Multi Head Latent Attention (MLA) 和 Stable LatentMoE 框架。该模型将 2.8 万亿个参数分配给 896 位专家,每个代币仅激活 16 个参数。这意味着在任何一次前向传递过程中大约有 1040 亿个参数处于活动状态,与前身 Kimi K2 相比,缩放效率提高了 2.5 倍。
Kimi K3 擅长长期编码任务、代理工作流程和复杂推理。它支持原生工具调用、结构化输出以及用于多步骤解决问题的始终在线思维模式。
模型可用性和格式
Kimi K3 的开放式配重可在 Hugging Face 上找到,型号标识符为 Moonshotai/Kimi-K3。权重以MXFP4(微尺度浮点4位)格式分布,为大规模推理部署提供了模型质量和内存效率之间的有效平衡。
基础设施要求
AWS 提供两种主要机制来获取此容量:
