CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
检索增强生成(RAG)利用外部知识增强了大型语言模型(LLM),但仍然受到长上下文和不相交的检索生成优化的影响。在这项工作中,我们提出了 CLaRa(连续潜在推理),这是一个在共享连续空间中执行基于嵌入的压缩和联合优化的统一框架。为了获得语义丰富且可检索的压缩向量,从而减少输入生成器的文档长度,我们引入了 SCP,一种基于问答和释义的密钥保留数据合成框架......
本文在 2026 年国际可用性、可靠性和安全性会议 (ARES) 的 AI4TCI(安全可信关键基础设施系统人工智能研讨会)研讨会上被接受。自主谈判代理越来越多地部署在保险和采购等高风险环境中。虽然加密技术可以保护明确披露的约束值,但它们无法解决更微妙的威胁:行为隐私泄露,对手从可观察的谈判动态(例如让步轨迹、时间安排和……)中推断出私人约束。
Disaggregated prefill and decode for LLM inference on SageMaker HyperPod
在本文中,我们将展示如何使用 HyperPod Inference Operator 在 Amazon SageMaker HyperPod 上通过 vLLM 实现 DPD。
Top 10 Books on Causal Inference
这十本书改变了社会科学家(包括您真正的科学家)思考和建立因果关系的方式。几十年来,社会科学严重依赖相关性和预测,经常将统计关联视为因果解释的证据。这些作品共同标志着这一方法的决定性转变。这一变化的核心是 [...]
Proxy-Pointer RAG: Temporal Reasoning Without Semantic Precompilation
Proxy-Pointer 和 LLM-Wiki 的技术比较后 Proxy-Pointer RAG:无需语义预编译的时间推理首先出现在 Towards Data Science 上。
Why AI Doesn’t Think, Cannot Reason, Isn’t Intelligent and Will Never Achieve Consciousness
Rob Urie 解决了人工智能吹捧者经常宣扬的关于人工智能可以做什么和不能做什么的常见误解。
Learning Structured Reasoning via Tractable Trajectory Control
大型语言模型可以表现出紧急推理行为,通常表现为重复出现的词汇模式(例如,“等待”,表示验证)。然而,在无约束采样中,复杂的推理轨迹仍然稀疏,并且标准强化学习通常无法保证获取多样化的推理行为。我们提出通过结构化推理来系统地发现和强化不同的推理模式,这种范式需要在强化学习过程中有针对性地探索特定的推理模式。为此,我们提出了 Ctrl-R,一个学习框架......
Conformal Thinking: Risk Control for Reasoning on a Compute Budget
推理大型语言模型 (LLM) 可实现测试时间扩展,随着令牌预算的增加,数据集级别的准确性也会提高,从而激励自适应推理——在可靠性提高时使用令牌,并在额外计算不太可能有帮助时提前停止。然而,设置代币预算以及自适应推理的阈值是一项实际挑战,需要进行基本的风险与准确性权衡。我们将预算设置问题重新定义为风险控制,限制错误率,同时最大限度地减少计算量。我们的框架引入了一个上限,可以阻止......
Adaptive parallel reasoning: the next paradigm in efficient inference scaling
自适应并行推理概述。如果推理模型可以自行决定何时分解和并行化独立子任务、生成多少个并发线程以及如何根据当前问题协调它们,会怎样?我们对并行推理领域的最新进展进行了详细分析,特别是自适应并行推理。披露:这篇文章部分是景观调查,部分是自适应并行推理的视角。作者之一 (Tony Lian) 共同领导了 ThreadWeaver (Lian et al., 2025),这是下面讨论的方法之一。作者旨在以自己的方式呈现每种方法。 动机 除了数据和参数缩放之外,LLM 推理能力的最新进展很大程度上是由推理时间缩放驱动的(OpenAI 等人,2024 年;DeepSeek-AI 等人,2025 年)。显式输
SpatialClaw: NVIDIA’s new approach to AI spatial reasoning
SpatialClaw 是 NVIDIA Research 最新的 AI 框架,使代理能够通过可执行的 Python 代码编写、执行和完善自己的推理,而不是依赖预定义的工具调用。该方法无需额外培训即可在复杂的 3D 和 4D 任务中显着提高空间智能。
3 Agents. 3 LLMs. 1 Aging GPU: Engineering Parallel Inference on Bare Metal
突破 8GB VRAM 限制。了解如何使用 C++ 层复用和准入控制在单个 8GB GPU 上运行三个不同的 LLM。后 3 个代理。 3 名法学硕士。 1 老化 GPU:裸机上的工程并行推理首先出现在《走向数据科学》上。
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
Token作为现代自回归模型的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有方法缺乏细粒度的长度建模,主要在粗粒度的序列级别上运行。在本文中,我们介绍了长度值模型(LenVM),这是一个令牌级框架,用于对每个解码步骤的剩余生成长度进行建模。通过将长度建模表述为价值估计问题,并为每个生成的代币分配恒定的负奖励,LenVM…
Diversified Portfolios Show Resilience Amid Escalating Iran War
随着伊朗战争不断升级,这场冲突再次变得越来越难以忽视,这强化了维持全球多元化投资组合的理由。其推理并非基于假设广泛的资产配置方法将优于其他策略或提供卓越的风险管理。尽管一种或两种结果都是可能的,但更强的情况 [...]
Show Me Examples: Inferring Visual Concepts from Image Sets
视觉语言模型 (VLM) 可以遵循复杂的文本指令,但它们很难从纯粹的视觉上下文中进行推理。特别是,当前的模型无法从示例图像集中推断出共享概念并将其应用于新的输入。我们引入了集合视觉概念推理(VICIS),这是一项评估这种能力的任务。给定共享概念和查询图像的一小部分上下文图像,模型必须生成新图像,以保留上下文定义的概念,同时与查询保持一致。我们证明最先进的 VLM 在这项任务上表现不佳......