CPU关键词检索结果

CPU上的推测解码:DFlash实现近4倍令牌生成加速

Speculative Decoding on CPUs: Nearly 4x Faster Token Generation with DFlash

推测性解码可以将未充分利用的 CPU 计算转化为更快的令牌生成,而无需更改模型的输出。在我们的 vLLM 测试中,DFlash 在并发数为 1 时在 Intel Xeon 6 上使用 Qwen3.5-9B 实现了 3.92 倍的自回归吞吐量。我们详细分析了加速的来源,解释了接受指标,并展示了决定推测是否有效的因素。CPU 上的推测解码:使用 DFlash 使令牌生成速度加快近 4 倍首先出现在《走向数据科学》上。

Pi 上的 AI:构建您自己的本地语音代理

AI on the Pi: Build Your Own Local Voice Agent

当我收到第一个 Raspberry Pi 时,我就知道这将是一个将人工智能带入物理世界的绝佳平台。由于最初的硬件对快速算术没有良好的 CPU 支持,我最终编写了在 GPU 上运行的代码,这样我就可以获得我需要的速度 [...]

构建代理 AI 的企业环境

Building the enterprise environment for agentic AI

对于企业来说,代理人工智能的承诺不仅仅是一个更好的聊天机器人。它是跨人员、业务工作流程、数据和系统端到端执行业务任务的软件代理。最适合运行代理的平台具有适当的 CPU 容量、弹性数据访问、策略感知工具的使用、可观察性、内存管理以及……

为什么添加更多 AI 代理会使我们的系统变慢

Why Adding More AI Agents Made Our System Slower

异步系统的隐性成本,在扩展数百个 LLM 代理时,微小的 CPU 任务如何悄然成为我们最大的瓶颈。为什么添加更多 AI 代理使我们的系统变慢的帖子首先出现在《走向数据科学》上。