GPUThor угрожает системам с графическими процессорами Nvidia
重复激活 GPU 中的内存线会导致位反转和系统受损。
Speed Up LLM Inference with DSpark Speculative Decoding
了解 DSpark 推测解码如何使用相同的 GPU、Qwen3-8B、llama.cpp 和 CUDA 来提高本地 LLM 生成速度。
Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2
当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。
Deepgram deepens Amazon SageMaker AI observability with Enhanced Metrics
自托管语音 AI 需要进行可观察性权衡:驱动容量规划和成本管理的数字被锁定在供应商容器内。 Deepgram 通过两项功能缩小了 Amazon SageMaker AI 的这一差距,这些功能可将计费、使用情况和每个 GPU 指标直接存入您自己的 Amazon CloudWatch 账户中。
Run Muse Glimmer for Local Vibe Coding with llama.cpp, DFlash, and Pi
使用 llama.cpp、DFlash 推测性解码和 Pi 在 RTX 3090 GPU 上本地运行 Muse Glimmer,以实现快速、私密、代理的 AI 编码。
New MIT Coding Technique Makes Some GPU Tasks Nearly Four Times Faster
研究人员开发了一种新的编程技术,通过教计算机跳过不会产生任何有用的计算,可以在图形处理单元 (GPU) 上进行一些计算,速度提高了近四倍。这项工作由麻省理工学院计算机科学和人工智能实验室 (CSAIL) 的研究人员领导,可以改善人工智能、科学模拟、图形的计算 […]《麻省理工学院新编码技术使一些 GPU 任务速度提高近四倍》一文首先出现在 Knowridge Science Report 上。
Stop Rate-Limiting Requests. Start Scheduling Tokens: Introducing DataRobot TokenGrid
作者:Sudeeptha Jothiprakash、Venkat Bala、Tushar Pandey、Romi Datta 现代 AI 堆栈的真正瓶颈企业 IT 存在一个奇怪的问题:代币支出和第三方模型订阅成本不断攀升,而运行这些工作负载的 GPU 集群的利用率仅为 20%。这种差距归结为一件事:管理访问的工具......后停止速率限制请求。开始调度令牌:DataRobot 简介 TokenGrid 首先出现在 DataRobot 上。
Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。
AI on the Pi: Build Your Own Local Voice Agent
当我收到第一个 Raspberry Pi 时,我就知道这将是一个将人工智能带入物理世界的绝佳平台。由于最初的硬件对快速算术没有良好的 CPU 支持,我最终编写了在 GPU 上运行的代码,这样我就可以获得我需要的速度 [...]