triton关键词检索结果

利用 Amazon EC2 上的 NVIDIA MPS 将 ASR 推理成本降低 75%

Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2

当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。