Part 2: Amazon Bedrock cost attribution with Amazon Athena and CUDOS
了解如何使用 Amazon Athena 和 CUDOS 控制面板可视化和分析 Amazon Bedrock 成本归因。本文展示了如何使用 IAM 主体数据设置 CUR 2.0,按主体、项目和团队查询 Bedrock 支出,以及构建仪表板来跟踪整个组织的 AI 成本。
Speed Up LLM Inference with DSpark Speculative Decoding
了解 DSpark 推测解码如何使用相同的 GPU、Qwen3-8B、llama.cpp 和 CUDA 来提高本地 LLM 生成速度。
Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2
当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。
Can an LLM Forget the Right Things?
大多数 LLM 推理运行时不知道存在物理截止日期。这个拒绝入场而不是错过 33 毫秒的机器人控制周期,通过意义而不是年龄驱逐 KV 缓存,并且完全用手写 CUDA 编写 - 没有 cuBLAS,没有 libtorch。 帖子 Can an LLM Forget the Right Things? 帖子 Can an LLM Forget the Right Things?首先出现在《走向数据科学》上。
Declining enrollment forces PSU to slash two departments, lay off staffers amid $35M budget crunch
在波特兰州立大学,为了在未来两年内解决 3500 万美元的预算赤字,正在取消两个学术部门并解雇 36 名员工。 PSU 校长安·卡德 (Ann Cudd) 最近宣布了此次削减,这是在经过谈判、校园和社区反馈以及多次修改后做出的。冲突[...]
Inflation still casts shadow over PHL economy as energy instability lingers, Metrobank says
大都会银行和信托公司 (Metrobank) 表示,长期石油危机波及交通、电力、食品和化肥成本,通胀压力继续给菲律宾带来风险。首都银行市场研究主管安娜·多米尼克·库迪亚(Anna Dominique Cudia)在一份报告中表示:“菲律宾仍然容易通过多种渠道受到长期能源中断的影响。” “在一起,更高的交通、电力、[...]
How To Build Your Own LLM Runtime From Scratch
如果您曾经想自己实际构建一个 LLM 推理运行时 — 打包自己的权重、拥有每个障碍、捕获自己的 CUDA 图表 — 这就是 H100 上的旅程。逐步浏览名为 annotated-llm-runtime 的小型运行时,以及产生大部分注释的三个错误。如何从头开始构建自己的 LLM 运行时一文首先出现在 Towards Data Science 上。