Speculative Decoding on CPUs: Nearly 4x Faster Token Generation with DFlash
推测性解码可以将未充分利用的 CPU 计算转化为更快的令牌生成,而无需更改模型的输出。在我们的 vLLM 测试中,DFlash 在并发数为 1 时在 Intel Xeon 6 上使用 Qwen3.5-9B 实现了 3.92 倍的自回归吞吐量。我们详细分析了加速的来源,解释了接受指标,并展示了决定推测是否有效的因素。CPU 上的推测解码:使用 DFlash 使令牌生成速度加快近 4 倍首先出现在《走向数据科学》上。
Kimi K3’s 1M Token Context Window vs. RAG: Cost, Latency and Answer Quality
对相同 12 个问题、相同系统提示和相同模型的前 5 个 RAG 管道和完整的 127,000 个令牌提示进行受控比较。对正确性、完整性和接地性进行盲评分。Kimi K3 的 1M 令牌上下文窗口与 RAG:成本、延迟和答案质量一文首先出现在 Towards Data Science 上。
Stop Rate-Limiting Requests. Start Scheduling Tokens: Introducing DataRobot TokenGrid
作者:Sudeeptha Jothiprakash、Venkat Bala、Tushar Pandey、Romi Datta 现代 AI 堆栈的真正瓶颈企业 IT 存在一个奇怪的问题:代币支出和第三方模型订阅成本不断攀升,而运行这些工作负载的 GPU 集群的利用率仅为 20%。这种差距归结为一件事:管理访问的工具......后停止速率限制请求。开始调度令牌:DataRobot 简介 TokenGrid 首先出现在 DataRobot 上。
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
Token作为现代自回归模型的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有方法缺乏细粒度的长度建模,主要在粗粒度的序列级别上运行。在本文中,我们介绍了长度值模型(LenVM),这是一个令牌级框架,用于对每个解码步骤的剩余生成长度进行建模。通过将长度建模表述为价值估计问题,并为每个生成的代币分配恒定的负奖励,LenVM…
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
大型语言模型的最新进展加剧了在有限推理预算内对高效可部署模型的需求。与从头开始训练目标规模模型相比,结构化剪枝管道在令牌效率方面显示出潜力。
Reduce RAG costs on Amazon Bedrock with query-aware compression
输入令牌通常是大规模运行检索增强生成 (RAG) 成本的重要组成部分。本文介绍了 Amazon Bedrock 上的查询感知上下文压缩模式:检索后,较小的模型会在主模型回答之前根据查询过滤检索到的块,从而减少输入令牌和成本,同时保持答案质量。
Building agentic workflows with SageMaker AI and Bedrock AgentCore
了解如何将 Amazon SageMaker AI 上与 OpenAI 兼容的终端节点与 Amazon Bedrock AgentCore 运行时相结合,以构建多代理工作流程,其中每个专业代理都使用最适合其工作的模型。这篇文章还展示了如何从 Strands Agent 默认情况下不检测的 SageMaker 端点获取令牌级别的可观测性。
Monitor on-premises and multi-cloud AI agents with AgentCore Observability
为在 AWS 外部运行的 AI 代理设置 Amazon Bedrock AgentCore Observability:本地、GCP、Azure 或开发人员计算机上。本演练使用 AWS Distro for OpenTelemetry (ADOT) 和 IAM 凭证将会话跟踪、跨度指标和令牌使用情况路由到同一 AgentCore Observability 仪表板。
Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine
大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:GPU 实例规模过大或首次生成令牌的时间过长。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。
Anthropic’s Pricing Shift Puts AI Consumption Risk Back On Customers
早在今年 5 月,Anthropic 就宣布改变其定价模式。其最初的固定费用、按席位订阅模式被将平台访问与人工智能消费分开的模式所取代。客户仍然需要为访问付费,但现在使用量是根据令牌消耗单独计量和计费的。在以前的模型下,客户被分为 [...]
Taming Outlier Tokens in Diffusion Transformers
我们研究用于图像生成的扩散变压器 (DiT) 中的异常标记。先前的工作表明,视觉变压器(ViT)可以产生少量高规范令牌,这些令牌在携带有限的本地信息的同时吸引了过多的注意力,但它们在生成模型中的作用仍未得到充分探索。我们证明这种现象出现在现代表示自动编码器(RAE)-DiT 管道的编码器和降噪器中:预训练的 ViT 编码器可以产生离群表示,而 DiT 本身可以开发内部离群标记,尤其是在中间层......
大型语言模型 (LLM) 在广泛的自然语言处理 (NLP) 任务(包括文档处理和代码生成)上取得了最先进的性能。自回归语言模型(ARM)根据所有先前的标记顺序生成标记,一直是法学硕士的主要范例。虽然这些模型在一系列下游任务中实现了高精度,但由于下一个令牌预测中固有的顺序依赖性,它们表现出较低的算术强度。最近,扩散语言模型 (DLM) 已成为一种有前途的......
A Guide to Saving Token Usage with Multi-Agent AI
如果您知道如何正确实施这四种节省令牌使用的策略,那么扩展和简化多代理架构并不一定会导致成本上升。
Security Affairs newsletter Round 588 by Pierluigi Paganini – INTERNATIONAL EDITION
新一轮的每周安全事务通讯已经到来!每周,安全事务部的最佳安全文章都会免费发送到您的电子邮箱中。享受新一轮的每周 SecurityAffairs 时事通讯,包括国际新闻。俄罗斯黑客劫持酒店 Wi-Fi 窃取 Microsoft 365 令牌 Adobe 修复了 [...] 中的一个最严重漏洞缺陷
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
最近的扩散模型可以生成高质量的视频,但运行时间很慢。这些模型中使用的基于变压器的大型骨干网受到时空注意力的瓶颈。在本文中,我们发现很大一部分令牌到令牌连接在各种输入中始终产生可以忽略不计的分数,并且它们的模式经常在查询中重复。因此,在这些情况下,注意力计算可以被跳过,对结果几乎没有影响。对于本地令牌块之间的连接,这一观察结果仍然成立。受此激励,我们...
Kali365 Targets US Organizations with Data Theft via Device Code Phishing
Kali365 针对美国组织实施滥用合法 Microsoft 身份验证的设备代码网络钓鱼攻击。网络钓鱼工具不会将受害者引导到虚假的登录表单,而是将他们发送到真实的 Microsoft 页面,在那里他们使用攻击者控制的设备代码来授权访问。这使得分析师更难发现攻击,并且对企业来说更加危险。通过获取 OAuth 访问和刷新令牌,攻击者可以持续访问 Microsoft 365 […]Kali365 通过设备代码网络钓鱼攻击美国组织的帖子首先出现在 ANY.RUN 的网络安全博客上。
Credentials should never reach the model
凭证永远不应到达模型 工程师将代理连接到支付 API。代理需要 API 令牌,因此令牌位于令牌通常所在的位置:环境变量、配置文件或直接进入提示符。客服人员会阅读并拨打电话。有用。它还刚刚放置了...帖子 Credentials should neverreach the model 首先出现在 DataRobot 上。