CUD关键词检索结果

第 2 部分:使用 Amazon Athena 和 CUDOS 进行 Amazon Bedrock 成本归因

Part 2: Amazon Bedrock cost attribution with Amazon Athena and CUDOS

了解如何使用 Amazon Athena 和 CUDOS 控制面板可视化和分析 Amazon Bedrock 成本归因。本文展示了如何使用 IAM 主体数据设置 CUR 2.0,按主体、项目和团队查询 Bedrock 支出,以及构建仪表板来跟踪整个组织的 AI 成本。

通过 DSpark 推测解码加速 LLM 推理

Speed Up LLM Inference with DSpark Speculative Decoding

了解 DSpark 推测解码如何使用相同的 GPU、Qwen3-8B、llama.cpp 和 CUDA 来提高本地 LLM 生成速度。

利用 Amazon EC2 上的 NVIDIA MPS 将 ASR 推理成本降低 75%

Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2

当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。

大语言模型能否正确遗忘?

Can an LLM Forget the Right Things?

大多数 LLM 推理运行时不知道存在物理截止日期。这个拒绝入场而不是错过 33 毫秒的机器人控制周期,通过意义而不是年龄驱逐 KV 缓存,并且完全用手写 CUDA 编写 - 没有 cuBLAS,没有 libtorch。 帖子 Can an LLM Forget the Right Things? 帖子 Can an LLM Forget the Right Things?首先出现在《走向数据科学》上。

入学率下降迫使 PSU 削减两个部门,并在 3500 万美元的预算紧缩中裁员

Declining enrollment forces PSU to slash two departments, lay off staffers amid $35M budget crunch

在波特兰州立大学,为了在未来两年内解决 3500 万美元的预算赤字,正在取消两个学术部门并解雇 36 名员工。 PSU 校长安·卡德 (Ann Cudd) 最近宣布了此次削减,这是在经过谈判、校园和社区反馈以及多次修改后做出的。冲突[...]

首都银行表示,由于能源不稳定,通货膨胀仍然给菲律宾经济蒙上阴影

Inflation still casts shadow over PHL economy as energy instability lingers, Metrobank says

大都会银行和信托公司 (Metrobank) 表示,长期石油危机波及交通、电力、食品和化肥成本,通胀压力继续给菲律宾带来风险。首都银行市场研究主管安娜·多米尼克·库迪亚(Anna Dominique Cudia)在一份报告中表示:“菲律宾仍然容易通过多种渠道受到长期能源中断的影响。” “在一起,更高的交通、电力、[...]

如何从头开始构建您自己的 LLM 运行时

How To Build Your Own LLM Runtime From Scratch

如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是 H100 上的旅程。逐步浏览名为 annotated-llm-runtime 的小型运行时,以及产生大部分注释的三个错误。如何从头开始构建自己的 LLM 运行时一文首先出现在 Towards Data Science 上。