Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。
Deploying Kimi K3 on Amazon SageMaker HyperPod and Amazon EKS
本文将介绍如何使用两种方法在 AWS 上部署 Kimi K3:Amazon SageMaker HyperPod 和 Amazon Elastic Kubernetes Service (Amazon EKS) 集群。
Disaggregated prefill and decode for LLM inference on SageMaker HyperPod
在本文中,我们将展示如何使用 HyperPod Inference Operator 在 Amazon SageMaker HyperPod 上通过 vLLM 实现 DPD。
Deploying Multi-Turn RL Infrastructure for Amazon Nova on Amazon SageMaker HyperPod
在本文中,您将在 Amazon SageMaker HyperPod 上使用 Amazon Nova Forge 部署用于多回合 RL 的两阶段基础设施。最后,您将拥有一个事件驱动的管道,当您将数据上传到 Amazon Simple Storage Service (Amazon S3) 时,该管道就会开始训练。训练作业教模型玩 Wordle,这是您自己的 RL 任务的占位符。