Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts
本文在 ICLR 2026 基础模型导航和解决数据问题研讨会上被接受。大型语言模型 (LLM) 可能很难记住其参数中的事实知识,通常会导致幻觉和在知识密集型任务中表现不佳。在本文中,我们从信息论的角度将事实记忆形式化,并研究训练数据分布如何影响事实准确性。我们表明,每当训练数据事实中包含的信息量超过模型时,事实准确性就不是最佳的(低于容量限制)......
Efficient Privacy Loss Accounting for Subsampling and Random Allocation
我们考虑采样方案的隐私放大属性,其中用户的数据在从 t 个步骤的序列(或集合)中随机且均匀选择的 k 个步骤中使用。这种采样方案最近已应用于差分私有优化(Chua et al., 2024a;Choquette-Choo et al., 2025)和通信高效的高维私有聚合(Asi et al., 2025)的背景下,它被证明比标准泊松采样具有效用优势。对这种抽样方案的理论分析(Feldman & Shenfeld,2025;Dong 等人,2025)得出……
ACM Human-Computer Interaction Conference (CHI) 2026
Apple 将于 4 月 13 日至 17 日在西班牙巴塞罗那举行的年度 ACM(计算机协会)CHI 计算系统人为因素会议上展示新的研究成果。我们很荣幸再次赞助该会议,该会议汇集了专注于人机交互的科学和工业研究社区。以下是 Apple 参与 CHI 2026 的概述。
LaCy: What Small Language Models Can and Should Learn is Not Just a Question of Loss
本文在 ICLR 基于 LLM 的代理系统内存研讨会上被接受。语言模型不断发展,将更多的世界知识压缩到其参数中,但可以预训练到其中的知识受到其参数大小的上限。特别是小语言模型(SLM)的容量是有限的,导致实际上不正确的生成。这个问题通常可以通过让 SLM 访问外部源来缓解:查询更大模型、文档或数据库的能力。在此背景下,我们研究的根本问题是……
A Theoretical Framework for Acoustic Neighbor Embeddings
本文提供了一个解释声学邻域嵌入的理论框架,声学邻域嵌入是固定维嵌入空间中可变宽度音频或文本的语音内容的表示。基于单词之间语音相似性的一般定量定义,提出了嵌入之间距离的概率解释。这为我们提供了一个以原则性方式理解和应用嵌入的框架。显示了支持均匀簇各向同性近似的理论和经验证据,这使我们能够......
Governance-Aware Agent Telemetry for Closed-Loop Enforcement in Multi-Agent AI Systems
企业多代理人工智能系统每小时产生数千次代理间交互,但现有的可观察性工具捕获这些依赖关系而不强制执行任何操作。 OpenTelemetry 和 Langfuse 收集遥测数据,但将治理视为下游分析问题,而不是实时执行目标。其结果是出现“观察但不采取行动”的差距,只有在造成损害后才会发现违反政策的行为。我们提出了治理感知代理遥测(GAAT),这是一种参考架构,可以闭合遥测收集和多代理自动策略执行之间的循环......
SQUIRE: Interactive UI Authoring via Slot QUery Intermediate REpresentations
前端开发人员创建 UI 原型来评估替代方案,这是一个反复迭代和细化的耗时过程。生成式 AI 代码助手只需通过聊天界面提示即可实现快速原型设计,而无需编写代码。然而,虽然这种交互为开发人员提供了灵活性,因为他们可以编写他们想要的任何提示,但它使得控制生成的内容变得具有挑战性。首先,自然语言本身可能含糊不清,使得开发人员很难准确地传达他们的意图。其次,模型可能会做出不可预测的响应……
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
尽管大型语言模型 (LLM) 具有复杂的通用功能,但它通常无法满足不同的个人偏好,因为标准的训练后方法(例如带有人类反馈的强化学习 (RLHF))会针对单一的全局目标进行优化。虽然组相对策略优化(GRPO)是一种广泛采用的同策略强化学习框架,但其基于组的归一化隐式假设所有样本都是可交换的,从而在个性化设置中继承了这一限制。这个假设将不同的用户奖励分布和......
ProText: A Benchmark Dataset for Measuring (Mis)gendering in Long-Form Texts
我们引入了 ProText,这是一个用于测量风格多样的长篇英语文本中的性别和性别错误的数据集。 ProText 跨越三个维度:主题名词(姓名、职业、头衔、亲属称谓)、主题类别(典型男性、典型女性、中性/非性别)和代词类别(男性、女性、中性、无)。该数据集旨在探索文本转换中的(错误)性别,例如使用最先进的大型语言模型进行摘要和重写,超越传统的代词解析基准并超越......
Entropy-Preserving Reinforcement Learning
策略梯度算法推动了语言模型推理的许多最新进展。他们的一个吸引人的特性是他们能够从自己的轨迹探索中学习,这一过程对于培育多样化和创造性的解决方案至关重要。正如我们在本文中所示,作为训练的一部分,许多策略梯度算法自然会减少熵,从而减少探索轨迹的多样性,从而产生越来越限制其探索能力的策略。在本文中,我们认为应该在整个训练过程中积极监测和控制熵。我们正式分析...
Beyond Real Data: Synthetic Data through the Lens of Regularization
当真实数据稀缺时,合成数据可以提高泛化能力,但过度依赖可能会导致分布不匹配,从而降低性能。在本文中,我们提出了一个学习理论框架来量化合成数据和真实数据之间的权衡。我们的方法利用算法稳定性来推导泛化误差范围,描述最佳合成与真实数据比率,以最小化预期测试误差作为真实分布和合成分布之间 Wasserstein 距离的函数。我们在内核脊的设置中激发我们的框架......
Less Gaussians, Texture More: 4K Feed-Forward Textured Splatting
现有的前馈 3D 高斯分布方法可预测像素对齐的图元,从而导致图元数量随着分辨率的增加而呈二次方增长。这从根本上限制了它们的可扩展性,使得 4K 等高分辨率合成变得棘手。我们引入了 LGTM(Less Gaussians,Texture More),这是一个克服分辨率缩放障碍的前馈框架。通过预测与每个基元纹理相结合的紧凑高斯基元,LGTM 将几何复杂性与渲染分辨率分离。这种方法可以实现高保真 4K 新颖视图合成,而无需……
Athena: Intermediate Representations for Iterative Scaffolded App Generation with an LLM
使用大型语言模型 (LLM) 生成完整用户界面的代码具有挑战性。用户界面很复杂,它们的实现通常由多个相互关联的文件组成,这些文件共同指定每个屏幕的内容、屏幕之间的导航流以及整个应用程序中使用的数据模型。为 LLM 制作包含足够详细信息以生成完整用户界面的单个提示具有挑战性,即使如此,结果通常是一个大且难以理解的文件,其中包含所有生成的...
To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models
状态空间模型 (SSM) 已成为序列建模中 Transformer 的主要替代方案。它们的主要优点是通过固定大小的内存和计算复杂性的线性缩放实现长上下文和长格式生成的效率。我们通过展示一个简单的理论结果来开始这项工作,表明 SSM 无法准确解决任何“真正的长形式”发电问题(在某种意义上我们正式定义),从而削弱了它们的主要竞争优势。然而,我们表明,可以通过允许 SSM 交互式访问外部工具来缓解这一限制。事实上,我们...
Drop-In Perceptual Optimization for 3D Gaussian Splatting
尽管 3D 高斯泼溅 (3DGS) 方法的输出最终被人类观看者使用,但它们通常依赖于像素级损失的临时组合,从而导致渲染模糊。为了解决这个问题,我们通过搜索不同的失真损失集来系统地探索 3DGS 的感知优化策略。我们对 3DGS 进行了首次大规模人类主观研究,涉及多个数据集和 3DGS 框架中的 39,320 个成对评分。 Wasserstein Distortion 的常规版本(我们称之为 WD-R)成为明显的赢家,擅长......
Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
虽然大型语言模型 (LLM) 的缩放法则传统上关注预训练损失等代理指标,但预测下游任务性能被认为是不可靠的。本文提出了一个直接框架来对培训预算中的基准性能扩展进行建模,从而挑战了这一观点。我们发现,对于固定的令牌与参数比,简单的幂律可以准确地描述多个流行下游任务的日志精度的缩放行为。我们的结果表明,直接方法比之前提出的两阶段程序更好地推断......
Thinking into the Future: Latent Lookahead Training for Transformers
本文被 ICLR 的潜在与内隐思维研讨会 - 超越 CoT 推理 2026 接受。使用下一个标记预测训练的自回归语言模型通过一次采样一个离散标记来生成文本。尽管具有很强的可扩展性,但这个目标迫使模型在每一步都做出承诺,从而阻止它探索或反思多个看似合理的延续。此外,跨代币的计算分配是统一的;每个令牌都是基于单个前向传递形成的,在困难令牌的情况下可能会限制模型的表达能力......
我们引入了专有自注意力(XSA),这是自注意力(SA)的简单修改,可以提高 Transformer 的序列建模性能。关键思想是限制注意力仅捕获与代币自身价值向量正交的信息(从而排除自身位置的信息),从而鼓励更好的上下文建模。在标准语言建模任务上进行评估时,XSA 在模型大小高达 2.7B 参数的情况下始终优于 SA,并且随着序列长度的增长显示出越来越大的增益。