Revisiting ASR Error Correction with Specialized Models
语言模型在自动语音识别 (ASR) 中发挥着核心作用,但大多数方法依赖于纯文本模型,不知道 ASR 错误模式。最近,大型语言模型 (LLM) 已应用于 ASR 校正,但引入了延迟和幻觉问题。我们使用紧凑的 seq2seq 模型重新审视 ASR 纠错,该模型针对真实和合成音频的 ASR 错误进行训练。为了扩展训练,我们通过级联 TTS 和 ASR 构建合成语料库,发现匹配现实错误分布的多样性是关键。我们提出校正优先解码,其中校正......
On-Device Local-Model "LLM Coherence": TABLE OF THE DAY
周日 MAMLM:当龙虾移动时:gemma4 正在教我“人工智能连贯性”...
HFO-1234yf Environmental Alternative Declared A Toxic Chemical
HFO-1234yf 环境替代品被宣布为有毒化学品HFO-1234yf 是环保人士吹捧的一种用于汽车空调系统的气候友好型替代制冷剂,但实际上可能比他们坚称造成污染的产品更严重。Hank CampbellMon,07/06/2026 - 18:01类别大气
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
网络复杂、开放且不断变化,这使得扩展可视网络代理的训练数据变得具有挑战性。现有的数据收集尝试仍然仅限于用于监督微调的离线轨迹或用于 RL 训练的少数模拟环境,因此无法捕获网络多样性。我们提出了Weblica(Web Replica),一个用于构建可复制和可扩展的Web环境的框架。我们的框架利用 1) HTTP 级缓存来捕获和重播稳定的视觉状态,同时保留交互行为,以及 2) 基于 LLM 的环境合成......
FlowEval: Reference-Based Evaluation of Generated User Interfaces
虽然大型语言模型 (LLM) 和编码代理通常应用于用户界面 (UI) 开发,但开发人员发现很难可靠地评估他们在视觉和交互设计方面的熟练程度。现有的评估要么依靠人类专家,他们可以通过测试关键流程来准确评估可用性,但速度慢且成本高;要么依靠自动化法官,虽然可扩展,但准确性较差且不透明。我们提出了 FlowEval,一个基于参考的框架,通过比较真实网站的导航轨迹与轨迹来衡量生成的 UI 是否支持真实的交互流......
Proxy-Pointer RAG: Temporal Reasoning Without Semantic Precompilation
Proxy-Pointer 和 LLM-Wiki 的技术比较后 Proxy-Pointer RAG:无需语义预编译的时间推理首先出现在 Towards Data Science 上。
LLM Wikis Are Over-Engineered — I Replaced Mine With a Pure Python Compiler
大多数“LLM wiki”使用代理、嵌入和重复模型调用来组织本地注释。我构建了一个确定性的替代方案:一个纯 Python 编译器,仅使用标准库将杂乱的 Markdown 转换为链接的、经过 linted 的 wiki。在此过程中,我修复了两个真正的错误,在两个操作系统上对管道进行了基准测试,并展示了为什么编译器通常比代理更适合机械文本组织。LLM 维基百科过度设计——我用纯 Python 编译器替换了我的编译器首先出现在《走向数据科学》上。
Multi-Agent Teams Hold Experts Back
多代理 LLM 系统越来越多地部署为自主协作者,其中代理可以自由交互,而不是执行固定的、预先指定的工作流程。在这种情况下,有效的协调无法提前完全设计,而必须通过互动来实现。然而,大多数先前的工作都是通过固定的角色、工作流程或聚合规则来强制协调,从而留下了一个问题:当协调不受限制时,自组织团队的表现如何。借鉴组织心理学,我们研究自组织法学硕士团队是否能实现强大的协同作用,其中......
Residual Context Diffusion Language Models
扩散大型语言模型 (dLLM) 已成为纯自回归语言模型的有前途的替代方案,因为它们可以并行解码多个标记。然而,最先进的分块 dLLM 依赖于“重新屏蔽”机制,该机制仅解码最有信心的令牌并丢弃其余令牌,从而有效地浪费了计算。我们证明,从丢弃的令牌中回收计算是有益的,因为这些令牌保留了对后续解码迭代有用的上下文信息。有鉴于此,我们提出了残余上下文扩散(RCD),该模块......
Learning Unmasking Policies for Diffusion Language Models
扩散(大型)语言模型 (dLLM) 现在在许多任务上与自回归模型的下游性能相匹配,同时有望在推理过程中提高效率。 dLLM 的一个关键设计方面是采样程序,该程序选择在每个扩散步骤中揭开哪些标记。事实上,最近的工作发现,与随机揭露相比,置信度阈值等启发式策略可以提高样本质量和令牌吞吐量。然而,这种启发式方法也有缺点:它们需要手动调整,而且我们观察到它们的性能......
Conformal Thinking: Risk Control for Reasoning on a Compute Budget
推理大型语言模型 (LLM) 可实现测试时间扩展,随着令牌预算的增加,数据集级别的准确性也会提高,从而激励自适应推理——在可靠性提高时使用令牌,并在额外计算不太可能有帮助时提前停止。然而,设置代币预算以及自适应推理的阈值是一项实际挑战,需要进行基本的风险与准确性权衡。我们将预算设置问题重新定义为风险控制,限制错误率,同时最大限度地减少计算量。我们的框架引入了一个上限,可以阻止......
MemoryLLM: Plug-n-Play Interpretable Feed-Forward Memory for Transformers
了解变压器组件在法学硕士中的工作原理非常重要,因为它是人工智能最新技术进步的核心。在这项工作中,我们重新审视了与前馈模块(FFN)的可解释性相关的挑战,并提出了 MemoryLLM,其旨在将 FFN 与自注意力解耦,并使我们能够将解耦的 FFN 作为上下文无关的 token-wise 神经检索记忆来研究。详细地,我们研究了输入标记如何访问 FFN 参数内的内存位置以及 FFN 内存在不同下游任务中的重要性。 MemoryLLM 实现...
On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
强化学习 (RL) 微调已成为增强推理密集型任务的大型语言模型 (LLM) 的关键技术,并推动其扩展到视觉语言模型 (VLM)。虽然经过 RL 调整的 VLM 改进了视觉推理基准,但它们仍然容易受到视觉基础薄弱、幻觉和过度依赖文本提示的影响。我们证明,简单的、受控的文本扰动——误导性的标题或不正确的思维链 (CoT) 痕迹——会导致鲁棒性和置信度大幅下降,并且当 CoT 一致性为……时,这些影响会更加明显。
Adaptive parallel reasoning: the next paradigm in efficient inference scaling
自适应并行推理概述。如果推理模型可以自行决定何时分解和并行化独立子任务、生成多少个并发线程以及如何根据当前问题协调它们,会怎样?我们对并行推理领域的最新进展进行了详细分析,特别是自适应并行推理。披露:这篇文章部分是景观调查,部分是自适应并行推理的视角。作者之一 (Tony Lian) 共同领导了 ThreadWeaver (Lian et al., 2025),这是下面讨论的方法之一。作者旨在以自己的方式呈现每种方法。 动机 除了数据和参数缩放之外,LLM 推理能力的最新进展很大程度上是由推理时间缩放驱动的(OpenAI 等人,2024 年;DeepSeek-AI 等人,2025 年)。显式输
Multi-tenant LLM analytics with row-level security: How we built a secure agent on AWS
在这篇文章中,我们将向您展示 PAR 如何构建一个生产就绪的多租户 LLM 分析系统,该系统通过三层架构强制执行行级安全性:使用 AWS SigV4 进行加密请求签名、Amazon Bedrock 上的语义验证以及通过 Split-Plane SQL 进行编程数据隔离。我们演示了每一层如何独立运行,以降低跨租户数据暴露的风险,即使 LLM 本身受到损害或操纵也是如此。
墙也是路跳过术语表。是的,这是编辑们喜欢的事情,因为著名的沟通指南“假设缺乏词汇,但不缺乏智力”,但那是当你为广大公众写作时。科幻小说读者很聪明。Hank CampbellMon, 06/29/2026 - 09:00类别随机想法
Implementing resilience patterns with Amazon Bedrock and LLM gateway
在本文中,您将学习在 AWS 上构建弹性生成 AI 应用程序的五种实用模式,从原生 Amazon Bedrock 功能发展到使用 LLM 网关的多模型编排。这些模式解决了现实世界的挑战,例如意外流量激增期间的配额耗尽,通过推理的地理分布最大化可用性,并帮助防止多租户环境中的嘈杂邻居问题。