gpu关键词检索结果

GPUThor 用 Nvidia GPU 威胁系统

GPUThor угрожает системам с графическими процессорами Nvidia

重复激活 GPU 中的内存线会导致位反转和系统受损。

通过 DSpark 推测解码加速 LLM 推理

Speed Up LLM Inference with DSpark Speculative Decoding

了解 DSpark 推测解码如何使用相同的 GPU、Qwen3-8B、llama.cpp 和 CUDA 来提高本地 LLM 生成速度。

利用 Amazon EC2 上的 NVIDIA MPS 将 ASR 推理成本降低 75%

Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2

当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。

Deepgram 通过增强指标加深 Amazon SageMaker AI 可观测性

Deepgram deepens Amazon SageMaker AI observability with Enhanced Metrics

自托管语音 AI 需要进行可观察性权衡:驱动容量规划和成本管理的数字被锁定在供应商容器内。 Deepgram 通过两项功能缩小了 Amazon SageMaker AI 的这一差距,这些功能可将计费、使用情况和每个 GPU 指标直接存入您自己的 Amazon CloudWatch 账户中。

使用 llama.cpp、DFlash 和 Pi 运行 Muse Glimmer 进行本地 Vibe 编码

Run Muse Glimmer for Local Vibe Coding with llama.cpp, DFlash, and Pi

使用 llama.cpp、DFlash 推测性解码和 Pi 在 RTX 3090 GPU 上本地运行 Muse Glimmer,以实现快速、私密、代理的 AI 编码。

继飞机、船舶、油田设备之后,IFSCA又将GPU租赁打造成GIFT城的金融产品

After aircraft, ships & oilfield equipment, IFSCA moves to make GPU leasing a financial product in GIFT City

该提议出台之际,印度正准备应对人工智能计算能力需求的急剧增长

新的 MIT 编码技术使一些 GPU 任务速度提高了近四倍

New MIT Coding Technique Makes Some GPU Tasks Nearly Four Times Faster

研究人员开发了一种新的编程技术,通过教计算机跳过不会产生任何有用的计算,可以在图形处理单元 (GPU) 上进行一些计算,速度提高了近四倍。这项工作由麻省理工学院计算机科学和人工智能实验室 (CSAIL) 的研究人员领导,可以改善人工智能、科学模拟、图形的计算 […]《麻省理工学院新编码技术使一些 GPU 任务速度提高近四倍》一文首先出现在 Knowridge Science Report 上。

停止速率限制请求。开始调度令牌:DataRobot TokenGrid 简介

Stop Rate-Limiting Requests. Start Scheduling Tokens: Introducing DataRobot TokenGrid

作者:Sudeeptha Jothiprakash、Venkat Bala、Tushar Pandey、Romi Datta 现代 AI 堆栈的真正瓶颈企业 IT 存在一个奇怪的问题:代币支出和第三方模型订阅成本不断攀升,而运行这些工作负载的 GPU 集群的利用率仅为 20%。这种差距归结为一件事:管理访问的工具......后停止速率限制请求。开始调度令牌:DataRobot 简介 TokenGrid 首先出现在 DataRobot 上。

使用 Curvine 在 Amazon SageMaker HyperPod 上为大型 LLM 提供分层 KV 缓存

Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine

大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。

Pi 上的 AI:构建您自己的本地语音代理

AI on the Pi: Build Your Own Local Voice Agent

当我收到第一个 Raspberry Pi 时,我就知道这将是一个将人工智能带入物理世界的绝佳平台。由于最初的硬件对快速算术没有良好的 CPU 支持,我最终编写了在 GPU 上运行的代码,这样我就可以获得我需要的速度 [...]