CUDA关键词检索结果

通过 DSpark 推测解码加速 LLM 推理

Speed Up LLM Inference with DSpark Speculative Decoding

了解 DSpark 推测解码如何使用相同的 GPU、Qwen3-8B、llama.cpp 和 CUDA 来提高本地 LLM 生成速度。

利用 Amazon EC2 上的 NVIDIA MPS 将 ASR 推理成本降低 75%

Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2

当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。

大语言模型能否正确遗忘?

Can an LLM Forget the Right Things?

大多数 LLM 推理运行时不知道存在物理截止日期。这个拒绝入场而不是错过 33 毫秒的机器人控制周期,通过意义而不是年龄驱逐 KV 缓存,并且完全用手写 CUDA 编写 - 没有 cuBLAS,没有 libtorch。 帖子 Can an LLM Forget the Right Things? 帖子 Can an LLM Forget the Right Things?首先出现在《走向数据科学》上。

如何从头开始构建您自己的 LLM 运行时

How To Build Your Own LLM Runtime From Scratch

如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是 H100 上的旅程。逐步浏览名为 annotated-llm-runtime 的小型运行时,以及产生大部分注释的三个错误。如何从头开始构建自己的 LLM 运行时一文首先出现在 Towards Data Science 上。