Apple机器学习研究领域信息情报检索

Apple的机器学习团队致力于进行机器学习和人工智能的最新研究。了解最新的进展。我们的机器学习研究团队合作交流,为每天改善数百万人生活的惊人体验作出贡献。

用于基于核的最优传输的专用半平滑牛顿方法

A Specialized Semismooth Newton Method for Kernel-Based Optimal Transport

基于内核的最优传输 (OT) 估计器提供了一种替代的功能估计程序来解决样本中的 OT 问题。最近的研究表明,在比较高维概率度量时,这些估计器比插件(基于线性编程)OT 估计器在统计上更有效[Vacher et al., 2021]。不幸的是,这种统计优势是以非常高昂的计算代价为代价的:因为它们的计算依赖于短步内点法(SSIPM),而这种方法在实践中会带来大量的迭代次数,所以这些估计器很快就会变得……

MVICAD2:具有延迟和扩张的多视图独立分量分析

MVICAD2: Multi-View Independent Component Analysis with Delays and Dilations

多视图设置中的机器学习技术面临着重大挑战,特别是在集成异构数据、对齐特征空间和管理特定于视图的偏差时。这些问题在神经科学中很突出,通过分析来自相同刺激的多个受试者的数据来揭示大脑活动动态。在脑磁图 (MEG) 中,信号是在头皮水平捕获的,估计大脑的潜在来源至关重要,尤其是在假设所有受试者的来源相似的群体研究中。常用的方法,比如Multi-View...

GRPO 超越英语:非英语和多语言环境中 GRPO 的大规模研究

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

带可验证奖励的强化学习 (RLVR) 通常通过组相对策略优化 (GRPO) 进行优化,已成为提高预训练语言模型推理能力的核心方法,但目前的研究仍然主要以英语为中心。我们对多语言和非英语 GRPO 进行了大规模的实证研究,涉及广泛的基础模型、训练语言和不同的推理语言奖励。我们发现,母语推理训练通常与英语推理训练差距很小。我们进一步观察到强...

当遗忘是免费的:利用低影响力点来降低计算成本

When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs

随着对机器学习中数据隐私的担忧不断增加,从训练模型中遗忘或删除特定数据点的能力变得越来越重要。尽管最先进的遗忘方法已经出现,但它们通常平等地对待遗忘集中的所有点。在这项工作中,我们通过询问是否需要删除对模型学习影响可忽略不计的点来挑战这种方法。 Through a comparative analysis of influence functions across language and vision tasks, we identify subsets of training data with negligible impact on model outputs…

套利:通过优势感知投机进行有效推理

Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

Error 500 (Server Error)!!1500.That’s an error.There was an error. Please try again later.That’s all we know.

缩放分类流程图

Scaling Categorical Flow Maps

style="text-indent: 2em; "Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling (LM), as they unlock a host of advantages currently reserved for continuous modalities, including accelerated sampling and tilting. Recently, several works have de

超越下一个标记预测:扩散与自回归语言模型的性能表征

Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models

大型语言模型 (LLM) 在广泛的自然语言处理 (NLP) 任务(包括文档处理和代码生成)上取得了最先进的性能。自回归语言模型(ARM)根据所有先前的标记顺序生成标记,一直是法学硕士的主要范例。虽然这些模型在一系列下游任务中实现了高精度,但由于下一个令牌预测中固有的顺序依赖性,它们表现出较低的算术强度。最近,扩散语言模型 (DLM) 已成为一种有前途的......

通过深度低阶残差蒸馏锁定预训练权重

Locking Pretrained Weights via Deep Low-Rank Residual Distillation

近年来,开放权重语言模型的质量有了显着提高。共享权重可以在不同的硬件和软件平台上使用,从而极大地促进了模型的采用。它们还允许更开放的研究和测试,用户可以将它们用作检查点,根据自己的需求对其进行微调,并可能重新分发它们。然而,在某些情况下,对修改这些权重以防止未经授权的使用的担忧可能超过给予用户这种自由的好处。防御这种适应并非易事:因为适应性......

DeepAmbigQA:用于 LLM 答案完整性基准测试的模糊多跳问题

DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...

驯服扩散变压器中的异常标记

Taming Outlier Tokens in Diffusion Transformers

我们研究用于图像生成的扩散变压器 (DiT) 中的异常标记。先前的工作表明,视觉变压器(ViT)可以产生少量高规范令牌,这些令牌在携带有限的本地信息的同时吸引了过多的注意力,但它们在生成模型中的作用仍未得到充分探索。我们证明这种现象出现在现代表示自动编码器(RAE)-DiT 管道的编码器和降噪器中:预训练的 ViT 编码器可以产生离群表示,而 DiT 本身可以开发内部离群标记,尤其是在中间层......

了解多模式法学硕士中的一致性:综合研究

Understanding Alignment in Multimodal LLMs: A Comprehensive Study

偏好对齐已成为提高大型语言模型 (LLM) 性能的关键组成部分,但其对多模态大型语言模型 (MLLM) 的影响仍相对未得到充分研究。与语言模型类似,用于图像理解任务的 MLLM 也会遇到幻觉等挑战。在 MLLM 中,幻觉不仅可以通过陈述不正确的事实而发生,还可以通过产生与图像内容不一致的响应而发生。 MLLM 对齐的主要目标是鼓励这些模型将响应与图像信息更紧密地对齐。最近...

降维与网络科学相遇:UMAP kNN 图上的意义构建

Dimensionality Reduction Meets Network Science: Sensemaking on UMAP’s kNN Graph

虽然 UMAP 广泛用于探索高维数据,但典型的工作流程侧重于其低维嵌入,很大程度上忽略了 UMAP 内部构造的丰富的 k 最近邻 (kNN) 图。在 UMAP 的 2D 投影引入失真之前,该图将数据流形编码在其原始高维空间中。我们展示了这种内部表示的未开发潜力,展示了应用于该图的标准图算法如何增强数据意义:(1) PageRank 识别代​​表性数据点,(2) k 核分解揭示密集......

MoMo:具有时空动作标记化的机器人操纵中的拨盘运动模式

MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization

为了在不同的环境中有效运行,机器人不仅必须准确地执行操作任务,而且还要根据任务、对象和交互设置调整其行为的展开方式。我们询问这种执行级别的变化是否可以作为跨任务共享的可重用行为因素来学习。我们提出了 MoMo,一个两阶段的模仿学习框架,由时空动作标记器和行为克隆转换器组成,该转换器将任务和连续运动模式条件作为输入。在六个真实的机器人操作任务中,改变这种条件会产生稳定的……

使用解耦时间深度扩散变压器进行内存高效音频合成

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

Siri Expressive Voices 完全在设备上实时合成丰富、可配置的语音,由 Apple 最强大的设备基础模型 AFM 3 Core Advanced 提供支持。这项工作展示了该功能背后的内存高效音频合成架构:一个去标记器,可在 Apple 矩阵协处理器 (AMX) 紧张的计算和内存预算内将基础模型发出的语义音频标记转换为高保真音频。我们使用三组件设计(流式传输)将语义音频标记转换为残差矢量量化(RVQ)表示形式……

GH-ESD:实例级视觉任务的基于假设驱动的误差切片发现

GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks

视觉模型在语义相干子集上的系统性失败(称为错误切片)揭示了鲁棒性和评估的局限性。现有的切片发现方法主要将切片建模为表示空间中的簇或预定义属性的组合。虽然对于图像级分类有效,但这种公式对于对象检测和分割等实例级任务来说是不够的,在这些任务中,失败通常是由上下文关系和空间基础的视觉模式引起的。我们提出 GH-ESD(扎根假设驱动的误差切片发现),...

LEAD:突破长视野推理中的不可恢复瓶颈

LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning

即使提供了高级策略,大型语言模型 (LLM) 中的长期执行仍然不稳定。通过评估受控算法难题,我们证明虽然分解对于稳定性至关重要,但极端分解会造成“不可恢复瓶颈”。我们表明,由于高度不均匀的错误分布,这个瓶颈变得至关重要,其中一些“硬”步骤上的一致错误变得不可逆转。为了解决这个问题,我们提出了前瞻增强原子分解(LEAD)。通过结合短期未来验证和聚合……

通过校准的稀疏注意力加速文本到视频的生成

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

最近的扩散模型可以生成高质量的视频,但运行时间很慢。这些模型中使用的基于变压器的大型骨干网受到时空注意力的瓶颈。在本文中,我们发现很大一部分令牌到令牌连接在各种输入中始终产生可以忽略不计的分数,并且它们的模式经常在查询中重复。因此,在这些情况下,注意力计算可以被跳过,对结果几乎没有影响。对于本地令牌块之间的连接,这一观察结果仍然成立。受此激励,我们...

为 API 调用代理生成无环境的综合数据

Environment-free Synthetic Data Generation for API-Calling Agents

训练调用 API 的大型语言模型 (LLM) 代理需要大量高质量的轨迹。然而,大规模收集此类数据通常需要具有可执行 API 和现实的、预先填充的后端数据库的完全实施的环境,从而造成可扩展性的主要瓶颈。为了克服这个问题,我们提出了一种无环境的合成数据生成方法,利用法学硕士作为动态数字世界模型。仅给定 API 规范,我们的方法就会生成模仿代理和有状态环境之间交互的轨迹。具体来说......