详细内容或原文请订阅后点击阅览
本地法学硕士的实际运行成本是多少?我测量了 Apple Silicon 上的每一瓦特
五种型号,持续发电,真正的壁式插座能源为 0.31 美元/千瓦时 - RTX-3090 数字预测的惊喜,只会更大。帖子本地 LLM 实际运行成本是多少? 《我测量了 Apple Silicon 上的每一瓦特》首先出现在《迈向数据科学》上。
来源:走向数据科学在您自己的硬件上是免费的。你买了机器,电是一个舍入误差,之后的每一个代币都是肉汁。最近的一篇《Towards Data Science》文章《运行本地法学硕士实际成本是多少?》通过对 RTX 3090 的功耗进行采样并根据实际电价对其进行定价,得出了一个数字。它的发现一直困扰着我:运行最昂贵的模型并不是最大的模型。每个令牌的成本跟踪吞吐量,而不是参数计数。
我没有 3090。我在具有 96 GB 统一内存的 M3 Ultra Mac Studio 上运行所有内容 — 没有独立 GPU,没有 VRAM,只有 CPU 和 GPU 共享的一个内存池。这是一台足够不同的机器,我想知道同样的惊喜是否成立,以及幅度有多大。所以我测量了它。五种型号,持续发电,真正的墙壁插座能源,按我的实际利用率定价。简而言之:惊喜不仅存在于 Apple Silicon 上,而且还变得更大。我的 1200 亿参数模型的每个代币比其四分之一大小的模型便宜五倍。
以下是我获取这些数字的方式,以及它们为何会出现这种情况的原因。
测量的工作原理
该工具是我构建的一个小工具,名为 TokenWatt。它是专为 Apple Silicon 构建的兼容 OpenAI 的代理:您将其指向已运行的任何本地推理服务器,它会逐字节转发每个请求,同时将其与能量测量值括起来。它通过 Apple 的 IOReport 接口读取整个 SoC 电源轨(活动监视器的能源选项卡也是基于该接口构建的),这意味着无需 sudo,无需外部仪器,只需芯片报告的有关自身的数字。它减去了滚动空闲基线,因此您正在测量请求的边际成本,而不是坐在那里呼吸的机器,并且它会根据您的电费对结果进行定价。我的价格是 0.31 美元/千瓦时。
