When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs
随着对机器学习中数据隐私的担忧不断增加,从训练模型中遗忘或删除特定数据点的能力变得越来越重要。尽管最先进的遗忘方法已经出现,但它们通常平等地对待遗忘集中的所有点。在这项工作中,我们通过询问是否需要删除对模型学习影响可忽略不计的点来挑战这种方法。 Through a comparative analysis of influence functions across language and vision tasks, we identify subsets of training data with negligible impact on model outputs…
style="text-indent: 2em; "Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling (LM), as they unlock a host of advantages currently reserved for continuous modalities, including accelerated sampling and tilting. Recently, several works have de
大型语言模型 (LLM) 在广泛的自然语言处理 (NLP) 任务(包括文档处理和代码生成)上取得了最先进的性能。自回归语言模型(ARM)根据所有先前的标记顺序生成标记,一直是法学硕士的主要范例。虽然这些模型在一系列下游任务中实现了高精度,但由于下一个令牌预测中固有的顺序依赖性,它们表现出较低的算术强度。最近,扩散语言模型 (DLM) 已成为一种有前途的......
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
Error 500 (Server Error)!!1500.That’s an error.There was an error. Please try again later.That’s all we know.
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
近年来,开放权重语言模型的质量有了显着提高。共享权重可以在不同的硬件和软件平台上使用,从而极大地促进了模型的采用。它们还允许更开放的研究和测试,用户可以将它们用作检查点,根据自己的需求对其进行微调,并可能重新分发它们。然而,在某些情况下,对修改这些权重以防止未经授权的使用的担忧可能超过给予用户这种自由的好处。防御这种适应并非易事:因为适应性......
Taming Outlier Tokens in Diffusion Transformers
我们研究用于图像生成的扩散变压器 (DiT) 中的异常标记。先前的工作表明,视觉变压器(ViT)可以产生少量高规范令牌,这些令牌在携带有限的本地信息的同时吸引了过多的注意力,但它们在生成模型中的作用仍未得到充分探索。我们证明这种现象出现在现代表示自动编码器(RAE)-DiT 管道的编码器和降噪器中:预训练的 ViT 编码器可以产生离群表示,而 DiT 本身可以开发内部离群标记,尤其是在中间层......
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
偏好对齐已成为提高大型语言模型 (LLM) 性能的关键组成部分,但其对多模态大型语言模型 (MLLM) 的影响仍相对未得到充分研究。与语言模型类似,用于图像理解任务的 MLLM 也会遇到幻觉等挑战。在 MLLM 中,幻觉不仅可以通过陈述不正确的事实而发生,还可以通过产生与图像内容不一致的响应而发生。 MLLM 对齐的主要目标是鼓励这些模型将响应与图像信息更紧密地对齐。最近...
Dimensionality Reduction Meets Network Science: Sensemaking on UMAP’s kNN Graph
虽然 UMAP 广泛用于探索高维数据,但典型的工作流程侧重于其低维嵌入,很大程度上忽略了 UMAP 内部构造的丰富的 k 最近邻 (kNN) 图。在 UMAP 的 2D 投影引入失真之前,该图将数据流形编码在其原始高维空间中。我们展示了这种内部表示的未开发潜力,展示了应用于该图的标准图算法如何增强数据意义:(1) PageRank 识别代表性数据点,(2) k 核分解揭示密集......
MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization
为了在不同的环境中有效运行,机器人不仅必须准确地执行操作任务,而且还要根据任务、对象和交互设置调整其行为的展开方式。我们询问这种执行级别的变化是否可以作为跨任务共享的可重用行为因素来学习。我们提出了 MoMo,一个两阶段的模仿学习框架,由时空动作标记器和行为克隆转换器组成,该转换器将任务和连续运动模式条件作为输入。在六个真实的机器人操作任务中,改变这种条件会产生稳定的……
Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
Siri Expressive Voices 完全在设备上实时合成丰富、可配置的语音,由 Apple 最强大的设备基础模型 AFM 3 Core Advanced 提供支持。这项工作展示了该功能背后的内存高效音频合成架构:一个去标记器,可在 Apple 矩阵协处理器 (AMX) 紧张的计算和内存预算内将基础模型发出的语义音频标记转换为高保真音频。我们使用三组件设计(流式传输)将语义音频标记转换为残差矢量量化(RVQ)表示形式……
GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks
视觉模型在语义相干子集上的系统性失败(称为错误切片)揭示了鲁棒性和评估的局限性。现有的切片发现方法主要将切片建模为表示空间中的簇或预定义属性的组合。虽然对于图像级分类有效,但这种公式对于对象检测和分割等实例级任务来说是不够的,在这些任务中,失败通常是由上下文关系和空间基础的视觉模式引起的。我们提出 GH-ESD(扎根假设驱动的误差切片发现),...
LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning
即使提供了高级策略,大型语言模型 (LLM) 中的长期执行仍然不稳定。通过评估受控算法难题,我们证明虽然分解对于稳定性至关重要,但极端分解会造成“不可恢复瓶颈”。我们表明,由于高度不均匀的错误分布,这个瓶颈变得至关重要,其中一些“硬”步骤上的一致错误变得不可逆转。为了解决这个问题,我们提出了前瞻增强原子分解(LEAD)。通过结合短期未来验证和聚合……
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
最近的扩散模型可以生成高质量的视频,但运行时间很慢。这些模型中使用的基于变压器的大型骨干网受到时空注意力的瓶颈。在本文中,我们发现很大一部分令牌到令牌连接在各种输入中始终产生可以忽略不计的分数,并且它们的模式经常在查询中重复。因此,在这些情况下,注意力计算可以被跳过,对结果几乎没有影响。对于本地令牌块之间的连接,这一观察结果仍然成立。受此激励,我们...
Environment-free Synthetic Data Generation for API-Calling Agents
训练调用 API 的大型语言模型 (LLM) 代理需要大量高质量的轨迹。然而,大规模收集此类数据通常需要具有可执行 API 和现实的、预先填充的后端数据库的完全实施的环境,从而造成可扩展性的主要瓶颈。为了克服这个问题,我们提出了一种无环境的合成数据生成方法,利用法学硕士作为动态数字世界模型。仅给定 API 规范,我们的方法就会生成模仿代理和有状态环境之间交互的轨迹。具体来说......
RayRoPE: Projective Ray Positional Encoding for Multi-View Attention
我们研究了多视图变换器的位置编码,该变换器处理来自一组姿势输入图像的标记,并寻求一种独特地编码补丁的机制,允许具有多频率相似性的 SE(3) 不变注意力,并且可以适应底层场景的几何形状。我们发现先前的(绝对或相对)多视图注意力编码方案不能满足上述要求,并提出 RayRoPE 来解决这一差距。 RayRoPE 表示基于相关光线的补丁位置,但利用沿光线的预测点而不是…
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
Token作为现代自回归模型的基本计算单位,生成长度直接影响推理成本和推理性能。尽管它很重要,但现有方法缺乏细粒度的长度建模,主要在粗粒度的序列级别上运行。在本文中,我们介绍了长度值模型(LenVM),这是一个令牌级框架,用于对每个解码步骤的剩余生成长度进行建模。通过将长度建模表述为价值估计问题,并为每个生成的代币分配恒定的负奖励,LenVM…
LVSum: A Benchmark for Timestamp-Aware Long Video Summarization
长视频摘要对多模态大语言模型 (MLLM) 提出了重大挑战,特别是在长时间保持时间保真度以及生成语义和时间上均基于的摘要方面。我们引入了 LVSum,这是一个人工注释的基准,用于评估具有细粒度时间对齐的长格式视频摘要。 LVSum 包含 72 个不同的视频,跨越 13 个领域,平均持续时间为 16 分钟,每个视频都注释有最多 10 个包含时间参考的人工生成的摘要。 We conduct a comprehensive evaluation…