Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2
当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。
语码转换 (CS),即同一话语中的不同语言,由于 CS 训练数据有限,给自动语音识别 (ASR) 带来了重大挑战。本文首次将迭代伪标记训练方法应用于 CS-ASR,证明了其在利用未标记数据来提高 CS-ASR 性能方面的有效性。该方法包括三个阶段:伪标签生成、两阶段双语模型训练和迭代改进。它首先从大型未标记语料库生成伪标签,创建半监督数据集。这……
Building Voice-Controlled AI Agents
构建语音控制的 AI 代理并不难,本文将管道分解为其实际组件:流式语音识别、转弯检测、流式生成、中断处理和语音约束下的工具调用,并展示了每个组件的职责。