Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2
当每个请求仅使用 GPU 的一小部分时,大规模提供自动语音识别 (ASR) 模型的成本高昂。了解 Amazon EC2 GPU 实例上的 NVIDIA CUDA 多进程服务 (MPS) 与 NVIDIA Triton 推理服务器如何将 GPU 基础设施削减 75%,同时将亚秒级延迟保持在每个 GPU 每秒 92.1 个请求。
Cato’s Londoño: Voluntary, Unpublished AI Testing Framework Won’t Reassure Anyone
最近的报道表明,白宫关于自愿测试新AI模型的框架不会公开发布。卡托研究所政策分析师Juan Londoño在一篇新博客中讨论了这如何引发更多问题……
PROOF-Gen: From Optimized Data to Better Distillation
在教师生成轨迹上的监督微调是将工具调用能力蒸馏到可部署模型的标准第一阶段。推动已发布工具调用代理的后训练流水线以每日或每周的节奏重新运行此阶段。
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
大型语言模型的最新进展加剧了在有限推理预算内对高效可部署模型的需求。与从头开始训练目标规模模型相比,结构化剪枝管道在令牌效率方面显示出潜力。
AI models flub these intelligence tests. Can you fare any better?
谜题和游戏自人工智能发展之初就一直是其核心。正如我们人类喜欢用填字游戏或逻辑谜题来测试智力一样,开发者也可以用游戏挑战来测试模型的发展程度。“机器学习”一词
Speculative Decoding on CPUs: Nearly 4x Faster Token Generation with DFlash
推测性解码可以将未充分利用的 CPU 计算转化为更快的令牌生成,而无需更改模型的输出。在我们的 vLLM 测试中,DFlash 在并发数为 1 时在 Intel Xeon 6 上使用 Qwen3.5-9B 实现了 3.92 倍的自回归吞吐量。我们详细分析了加速的来源,解释了接受指标,并展示了决定推测是否有效的因素。CPU 上的推测解码:使用 DFlash 使令牌生成速度加快近 4 倍首先出现在《走向数据科学》上。
How to Leverage Local Small Language Models for Your Projects
在您自己的硬件上运行紧凑、保护隐私的语言模型的实用指南,以实现更快、更便宜且更可控的人工智能应用程序。
Scaling Laws for Mixture Pretraining Under Data Constraints
随着语言模型的扩展,它们所需的数据量也在增长,但许多目标数据源(例如低资源语言或专业领域)本质上在大小上受到限制。一种常见的策略是将这种稀缺但有价值的目标数据与丰富的通用数据混合在一起,这提出了一个基本的权衡:混合物中的目标数据太少会使模型在目标域中暴露不足,而太多的目标数据会过度重复相同的示例,从而产生收益递减并最终导致过度拟合。我们在 2,000 多次语言模型训练中研究了这种权衡……
What to Expect From LLM Customization Services
LLM 定制服务可帮助组织调整语言模型应用程序以适应特定的业务任务、知识源、术语、工作流程和安全要求。这项工作可以包括即时设计、检索增强生成、工具集成、微调、评估、部署和持续优化。定制不应从必须训练新模型的假设开始。在...阅读更多»法学硕士定制服务的期望一文首先出现在大数据分析新闻上。
上周我在 Twitter 上发布的一些有趣的链接(我还在 Mastodon、Threads、Newsmast 和 Bluesky 上发布了这些链接):Meta 站在开放 AI 模型的一边:https://www.rnz.co.nz/news/world/971653/meta-just-picked-a-side-in-a-big-debate-over-the-future-of-aiIndia 希望使用 AI 为那些需要批准贷款的人提供贷款否则不会得到它们。因为 2008 年并没有真正发生:https://www.theregister.com/ai-and-ml/2026/08/12/i
Soft Computing, Volume 30, Issue 7, July 2026
1) 基于拉格朗日插值的优化算法,用于数值优化和航天器轨迹问题作者:Apu Kumar Saha, Sanjoy Chakraborty, Sushmita Sharma 页数:4569 - 46022) Generalizations of k-generications 作者:Jing Jing Yue,Xue-ping Wang 页数:4603 - 46123) Lifting Filters in residuationlaties and它们在多值决策中的应用作者:Saeed Rasouli 页数:4613 - 46334) 模糊参数期权定价模型的守恒定律和精确解作者:Mohamma
Trade War with Canada: Wisconsin Awaits Retaliation
任何熟悉贸易引力模型的人都不会惊讶于威斯康星州向加拿大(出口)大量产品。图 1:威斯康星州向世界(黑色,右轴)、加拿大(蓝色,左轴)、墨西哥(红色轴)的商品出口,2017 年百万美元。名义数据经 BEA 平减指数缩减。浅橙色阴影表示特朗普政府。资料来源:人口普查(ITA)、BEA(FRED)、[...]
Стоимость развертывания LLM за год выросла почти втрое
MWS Cloud 分析了运行世界领先的俄罗斯大语言模型的计算基础设施需求。据估计,运行一种模型的最低 Nvidia 加速器组的平均成本已从 1370 万卢布增加。 2025年达到3880万卢布。 2026 年——2.8 倍。
Kimi K3’s 1M Token Context Window vs. RAG: Cost, Latency and Answer Quality
对相同 12 个问题、相同系统提示和相同模型的前 5 个 RAG 管道和完整的 127,000 个令牌提示进行受控比较。对正确性、完整性和接地性进行盲评分。Kimi K3 的 1M 令牌上下文窗口与 RAG:成本、延迟和答案质量一文首先出现在 Towards Data Science 上。
Serve Launches Robot Delivery with Wonder, Adding Grubhub to Its Growing Delivery Network
- 扩展到圣何塞和华盛顿特区,迈阿密的创新微型仓库,为商家提供的新硬件产品,以及新的广告服务,所有这些都提高了车队利用率 - 新型医院机器人 Moxi 2.0,处理能力提高了 15 倍,标志着新机器人世界模型的推出
Diligent Robotics, a Serve Robotics Company, Begins Rolling Out Moxi 2.0
下一代硬件和人工智能可提供更快、更可靠的医院物流,并标志着新机器人世界模型的推出
Потребление китайских LLM в России выросло более чем в 11 раз
MWS云分析了俄罗斯企业对中国大语言模型的消费情况。 2026年上半年的消费量比2025年全年高出11倍多。
Black Hat USA 2026: What the Hugging Face hack tells us about human responsibility
涉及 OpenAI 模型的事件表明,自主黑客行为使人类监督变得更加重要,而不是更少