详细内容或原文请订阅后点击阅览
如何从头开始构建您自己的 LLM 运行时
如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是 H100 上的旅程。逐步浏览名为 annotated-llm-runtime 的小型运行时,以及产生大部分注释的三个错误。如何从头开始构建自己的 LLM 运行时一文首先出现在 Towards Data Science 上。
来源:走向数据科学TL;DR 放在前面,这样您就可以留下要点:如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是在适用于 Qwen2.5-Coder-7B 的 NVIDIA H100 (Hopper,sm_90) 上的旅程。您将对 warp 专门化、TMA、__syncthreads() 产生强烈的看法,并且 CUDA 图不是一个额外的好处,而是一个必需品。本文介绍了一个名为 annotated-llm-runtime 的小型 LLM 运行时(大约有两打 CUDA/C++ 源文件,每个热路径都注释了原因,而不仅仅是内容)以及产生大部分注释的三个战争(比喻)故事。
Github Repo(稍后将在整个帖子中大量使用):https://github.com/AnubhabBanerjee/Annotated-LLM-Runtime
