Apple机器学习研究领域信息情报检索

Apple的机器学习团队致力于进行机器学习和人工智能的最新研究。了解最新的进展。我们的机器学习研究团队合作交流,为每天改善数百万人生活的惊人体验作出贡献。

当遗忘是免费的:利用低影响力点来降低计算成本

When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs

随着对机器学习中数据隐私的担忧不断增加,从训练模型中遗忘或删除特定数据点的能力变得越来越重要。尽管最先进的遗忘方法已经出现,但它们通常平等地对待遗忘集中的所有点。在这项工作中,我们通过询问来挑战这种方法:是否需要删除对模型学习影响可忽略不计的点?通过对语言和视觉任务的影响函数进行比较分析,我们确定了对模型输出影响可以忽略不计的训练数据子集……

使用混合文本和 ID 嵌入个性化增量视频搜索

Personalizing Incremental Video Search with Hybrid Text and ID Embeddings

增量视频搜索需要在每次击键后进行高质量排名,而意图通常不明确(例如,1-3 个字符前缀)。我们提出了一个 Apple TV 搜索的个性化系统,该系统在排名时结合了互补的语义和协作信号。我们的方法学习两个项目嵌入空间:(i) 基于文本的多语言编码器 (TextEmb),通过对比学习对共同参与三元组进行微调;(ii) 基于 ID 的协作嵌入模型 (IdEmb),根据交互衍生的积极因素进行训练。在服务时,我们从…构建用户表示

一般分布属性的交互式证明

Interactive Proofs for General Distribution Properties

假设 Alice 从未知分布中收集了少量样本,并且想了解该分布。鲍勃是一位不受信任的数据分析师,他声称已经对分布进行了复杂的数据分析,并对其属性做出了断言。 Alice 何时以及如何有效地验证 Bob 的声明(使用比自己运行分析所需的资源更少的资源)?我们为可以由有界深度电路决定的一般分布属性构建了交互式证明系统。取 N 为分布的上限...

函数的位置不变属性与分布属性:在测试中统一,在验证中分离

Location-Invariant Properties of Functions Versus Properties of Distributions: United in Testing but Separated in Verification

如果函数的属性可以用函数中每个值出现的频率来表征,而不管每个值出现的位置如何,则该属性称为位置不变(或对称)。众所周知,测试函数位置不变属性的(查询)复杂性与测试相应分布(的相应属性)的(样本)复杂性密切相关。当前工作的主要信息是,这种密切关系并没有在验证的背景下维持。当考虑到......时这两者都成立

极其简单的自蒸馏改进了代码生成

Embarrassingly Simple Self-Distillation Improves Code Generation

大型语言模型 (LLM) 能否在没有验证器、教师模型或强化学习的情况下仅使用其自己的原始输出来改进代码生成?我们通过简单自蒸馏(SSD)给出肯定的答案:从具有特定温度和截断配置的模型中抽取样本解决方案,然后使用标准监督微调对这些样本进行微调。 SSD 在 LiveCodeBench v6 上将 Qwen3-30B-Instruct 从 42.4% 提高到 55.3% pa​​ss@1,收益主要集中在更难的问题上,并且它在 4B、8B 和 30B 规模的 Qwen 和 Llama 模型上进行了推广,包括......

双次线性交互式邻近证明

Doubly Sub-linear Interactive Proofs of Proximity

我们研究双次线性交互式邻近证明(dsIPP):生成速度超快的证明,可用于证明有关巨大输入的近似断言。证明生成速度超快,因为它只需要读取输入的一小部分(亚线性)。证明的近似验证甚至更快(读取输入的更小部分)。与属性测试文献类似,近似验证意味着亚线性时间诚实证明者可以使验证者接受属性中的每个输入,但没有证明者可以欺骗验证者......

一层就足够了:采用预训练的视觉编码器进行图像生成

One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation

视觉生成模型(例如扩散模型)通常在压缩的潜在空间中运行,以平衡训练效率和样本质量。与此同时,人们对利用高质量的预训练视觉表示越来越感兴趣——无论是在 VAE 内对齐它们还是直接在生成模型内对齐它们。然而,由于面向理解的特征和生成友好的潜在空间之间的根本不匹配,适应这种表示仍然具有挑战性。表示编码器受益于高维潜伏,捕捉不同的假设......

LLM 函数调用的不确定性量化

Uncertainty Quantification for LLM Function-Calling

大型语言模型 (LLM) 越来越多地用于自主解决现实世界的任务。其中一个关键要素是法学硕士函数调用范式,这是一种广泛使用的方法,为法学硕士配备工具使用功能。然而,LLM 错误地调用函数可能会产生严重影响,特别是当其影响不可逆转时,例如转账或删除数据。因此,在执行函数调用之前,考虑法学硕士对函数调用正确解决任务的信心至关重要。不确定性量化(UQ)方法可用于量化……

CLaRa:通过连续潜在推理连接检索和生成

CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning

检索增强生成(RAG)利用外部知识增强了大型语言模型(LLM),但仍然受到长上下文和不相交的检索生成优化的影响。在这项工作中,我们提出了 CLaRa(连续潜在推理),这是一个在共享连续空间中执行基于嵌入的压缩和联合优化的统一框架。为了获得语义丰富且可检索的压缩向量,从而减少输入生成器的文档长度,我们引入了 SCP,一种基于问答和释义的密钥保留数据合成框架......

Apple Music 搜索的多语言语义检索

Multilingual Semantic Retrieval for Apple Music Search

Apple Music 以数十种语言为 150 多个店面的听众提供服务,其目录每天都会增加数十万首新曲目。在这种规模下,拼写错误、音译和跨语言查询的搜索召回成为会话质量的主要驱动因素,特别是对于占唯一查询大部分的尾部查询。我们提出了一个基于 305M 参数暹罗双编码器的多语言语义检索系统,该编码器根据 GTE 多语言基础进行了微调,并具有课程安排的多目标训练。该模型通过...集成到搜索堆栈中

主动代理研究环境:模拟活跃用户评估主动助理

Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

预测用户需求并自动执行任务的主动代理作为数字助理具有广阔的前景,但缺乏现实的用户模拟框架阻碍了它们的发展。现有方法将应用程序建模为平面工具调用 API,无法捕获数字环境中用户交互的状态和顺序性质,并使真实的用户模拟不可行。我们引入主动代理研究环境(Pare),这是一个用于在数字环境中构建和评估主动代理的框架。将应用程序建模为有限状态机......

代理谈判中的行为隐私泄露:通过随机策略形式化和减轻推理攻击

Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies

本文在 2026 年国际可用性、可靠性和安全性会议 (ARES) 的 AI4TCI(安全可信关键基础设施系统人工智能研讨会)研讨会上被接受。自主谈判代理越来越多地部署在保险和采购等高风险环境中。虽然加密技术可以保护明确披露的约束值,但它们无法解决更微妙的威胁:行为隐私泄露,对手从可观察的谈判动态(例如让步轨迹、时间安排和……)中推断出私人约束。

激励以自我为中心的视频理解模型中的时间意识

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

多模态大语言模型 (MLLM) 最近在视觉理解方面表现出了强大的性能,但它们往往缺乏时间意识,特别是在以自我为中心的环境中,其中推理取决于事件的正确排序和演变。这种缺陷部分源于训练目标未能明确奖励时间推理,而是依赖于帧级空间快捷方式。为了解决这个限制,我们提出了时态全局策略优化(TGPO),这是一种具有可验证奖励的强化学习(RLVR)算法,旨在激励时态……

递归语言模型遇到不确定性:自我反思程序搜索长上下文的惊人效果

Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context

长上下文处理仍然是语言模型的核心挑战:即使具有扩展的上下文窗口,模型通常也无法跨长上下文可靠地提取、推理和使用信息。最近的工作,如递归语言模型(RLM),通过推理时的编程交互将长上下文分解为递归子查询的代理方式来应对这一挑战。尽管前景广阔,但 RLM 的成功关键取决于如何选择这些情境交互程序的轨迹,而这一点尚未得到探索。在本文中,我们研究这个问题......

揭秘按策略蒸馏:它有帮助的地方、有伤害的地方以及原因

Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why

在策略蒸馏为训练推理模型提供密集的、按令牌的监督;然而,目前尚不清楚该信号在哪些条件下有益,在哪些条件下有害。应该采用哪种教师模式,在自我蒸馏的情况下,应该以哪种具体情境作为监督信号?不同代币的最佳选择是否有所不同?目前,解决这些问题通常需要昂贵的训练运行,其总体性能指标掩盖了单个代币级别的动态。我们推出了免培训...

FlowEval:生成的用户界面的基于参考的评估

FlowEval: Reference-Based Evaluation of Generated User Interfaces

虽然大型语言模型 (LLM) 和编码代理通常应用于用户界面 (UI) 开发,但开发人员发现很难可靠地评估他们在视觉和交互设计方面的熟练程度。现有的评估要么依靠人类专家,他们可以通过测试关键流程来准确评估可用性,但速度慢且成本高;要么依靠自动化法官,虽然可扩展,但准确性较差且不透明。我们提出了 FlowEval,一个基于参考的框架,通过比较真实网站的导航轨迹与轨迹来衡量生成的 UI 是否支持真实的交互流......

通过高级模态条件和交互来驯服文本到声音视频的生成

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

这项研究的重点是文本到声音视频 (T2SV) 生成,旨在生成具有文本同步音频的视频,两种模式都与文本条件一致。尽管联合音视频训练取得了进展,但仍然存在两个关键挑战:(1)文本调节是一个瓶颈——共享字幕(TV = TA)触发模态干扰,而密集的训练字幕和简洁的推理用户提示之间仍然存在差距;(2)跨模态特征交互的最佳融合机制仍不清楚。为了解决第一个挑战,我们首先提出......

LensVLM:用于文本压缩视觉表示的选择性上下文扩展

LensVLM: Selective Context Expansion for Compressed Visual Representation of Text

视觉语言模型 (VLM) 提供了将文本处理为渲染图像的令人兴奋的可能性,无需将文本标记为长标记序列。由于 VLM 图像编码器将固定大小的图像映射到固定数量的视觉标记,因此不同的渲染分辨率提供了细粒度的压缩旋钮。然而,随着压缩率的增加,准确性会迅速下降:字符缩小到低于视觉编码器的有效分辨率,使它们难以区分。为了解决这个问题,我们提出了 LensVLM,这是一个推理框架和训练后配方,使 VLM 能够扫描……