Apple机器学习研究领域信息情报检索

Apple的机器学习团队致力于进行机器学习和人工智能的最新研究。了解最新的进展。我们的机器学习研究团队合作交流,为每天改善数百万人生活的惊人体验作出贡献。

归一化流是能力的生成模型

Normalizing Flows are Capable Generative Models

标准化流(NFS)是基于连续输入的可能性模型。他们在密度估计和生成建模任务上都表现出了令人鼓舞的结果,但近年来受到了相对较少的关注。在这项工作中,我们证明了NFS比以前认为的强大。我们提出TARFLOW:一种简单且可扩展的体系结构,可实现高性能的NF模型。 TARFlow可以被认为是基于变压器的掩蔽自回旋流量(MAFS)的变体:它由图像补丁上的一堆自动回归变压器块组成……

语音主张的歧视性撤销语音搜索错误校正

Phonetically-Augmented Discriminative Rescoring for Voice Search Error Correction

端到端(E2E)自动语音识别(ASR)模型是使用配对的音频文本样本训练的,这些样品的获取昂贵,因为高质量的地面图数据需要人体注释。语音搜索应用程序(例如数字媒体播放器)利用ASR允许用户通过语音搜索而不是屏幕键盘。但是,在E2E ASR系统的训练数据中可能没有足够的代表或不足的电影标题,因此可能会受到较差的认可。在本文中,我们提出了一个语音校正系统,该系统由(a)基于…

StarFlow:高分辨率图像合成

STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis

我们提出了Starflow,这是一种基于标准化流的可扩展生成模型,可在高分辨率图像合成中实现强大的性能。 Starflow的核心是变压器自回旋流量(TARFLOW),它结合了标准化流的表达能力与自回旋变压器的结构化建模功能。我们首先建立了TARFLOW的理论普遍性,用于建模连续分布。在这个基础的基础上,我们介绍了几种关键的建筑和算法创新,以显着提高可扩展性:(1)深刺……

变分的整流流匹配

Variational Rectified Flow Matching

我们研究变异的整流流匹配,该框架通过建模多模式速度矢量场来增强经典的整流流匹配。在推理时,经典的整流流匹配“移动”样品通过沿速度向量场的集成求解普通的微分方程,从源分布到目标分布。在训练时,通过线性插值从源来绘制的耦合样品和一个随机从目标分布中绘制的耦合样品,从而学习了速度矢量场。这导致“地面真相”'速度…

通过强大数据处理不平等的数据记忆中的权衡取舍

Trade-offs in Data Memorization via Strong Data Processing Inequalities

最近的研究表明,培训大语言模型涉及大量培训数据的记忆。在敏感用户数据上培训培训时,这种记忆可能会导致侵犯隐私,从而激发了对数据记忆在学习中的作用的研究。在这项工作中,我们开发了一种通用方法来证明过度数据记忆的下限,该方法依赖于强烈的数据处理不平等和数据记忆之间的新联系。然后,我们证明了几个简单而自然的二进制分类问题在…

通过预测用户编写样本的偏好来对齐LLM

Aligning LLMs by Predicting Preferences from User Writing Samples

适应人类的偏好对于创建提供个性化和有效互动的一致性LLM代理至关重要。最近的工作表明,LLM充当写作代理来推断用户偏好的描述。然后,代理对齐来自根据推论的偏好描述的条件。但是,现有方法通常会产生通用的偏好描述,而这些描述无法捕获人类偏好的独特性和个性化的性质。本文介绍了散文,这种方法旨在增强用户推论的偏好描述的精度…

inrflow:环境空间中INR的流量匹配

INRFlow: Flow Matching for INRs in Ambient Space

流量匹配模型已成为一种强大的方法,用于在图像或视频(例如3D点云甚至蛋白质结构)等不规则或非结构化数据等域上产生建模。这些模型通常在两个阶段进行训练:首先是训练数据压缩机,在随后的训练阶段,流动匹配生成模型在数据压缩机的潜在空间中进行了训练。这个两阶段的范式设定了跨数据域统一模型的障碍,因为手工制作的压缩机体系结构用于不同的数据模式。为此,我们…

CVPR 2025

Apple Machine Learning Research at CVPR 2025

苹果研究人员正在通过基础研究来推进AI和ML,并支持更广泛的研究社区并帮助加速该领域的进步,我们通过在会议上的出版和参与分享我们的大部分研究。本周,IEEE/CVF计算机视觉和模式识别会议(CVPR)将在田纳西州的纳什维尔举行。苹果很荣幸能再次参加社区的这一重要活动,并成为行业赞助商。在主要会议和相关的研讨会上,苹果研究人员将在许多…

思维的幻想:通过问题复杂性的角度了解推理模型的优势和局限性

The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity

最近几代的边境语言模型引入了大型推理模型(LRMS),该模型在提供答案之前生成详细的思维过程。尽管这些模型可以提高推理基准的性能,但它们的基本功能,尺度属性和局限性仍然不足以理解。当前的评估主要是关于已建立的数学和编码基准的FO-CUS,强调了最终答案的准确性。但是,这种评估范式通常会遭受数据污染,并且不能为推理迹象提供见解。

代理-FDA:基于代理的特征分配对齐,用于微调视觉基础模型,而无需忘记

Proxy-FDA: Proxy-Based Feature Distribution Alignment for Fine-Tuning Vision Foundation Models Without Forgetting

Vision Foundation基础模型在大规模数据上进行了预训练,编码了现实世界概念的丰富表示形式,可以通过微调将其适用于下游任务。但是,一项任务的微调基础模型通常会导致概念忘记其他任务的问题。最新的良好微调方法旨在减轻忘记先验知识而不影响微调的性能。通常通过匹配原始和微调的模型权重或特征对来保留知识。但是,这样的点匹配可能太强了,而没有明确的意识……

改善视力语言模型的思想链推理

Improve Vision Language Model Chain-of-thought Reasoning

视觉语言模型(VLMS)中的思考链(COT)推理对于改善无法释放性和可信赖性至关重要。但是,当前的培训食谱通常依赖于以统一理由为主导的ondatasets。在这项工作中,我们表明对简短答案的VLM进行训练会导致较差的推理任务,要求详细解释。为了解决这一局限性,我们提出了一个两阶段的培训后策略,该术时扩展了简短的答案数据以增强COT推理的用法。首先,用……

语音质量尺寸为非典型语音和影响

Voice Quality Dimensions as Interpretable Primitives for Speaking Style for Atypical Speech and Affect

知觉语音质量维度描述了非典型语音和其他语音调制的关键特征。在这里,我们开发和评估了七个语音和语音维​​度的语音质量模型(可理解性,不精确的辅音,苛刻的声音,自然,单片,莫诺维奇和呼吸)。对公共语音可访问性(SAP)项目数据集进行了培训,其中有434位扬声器的11,184个样本,使用冷冻预培训模型的嵌入作为功能。我们发现,我们的探针在语音引起的探针既有强大的表现又有强烈的概括……

超越文本压缩:评估跨量表的引物

Beyond Text Compression: Evaluating Tokenizers Across Scales

令牌设计师的设计显着影响语言模型性能,但是评估令牌质量仍然具有挑战性。尽管文本压缩已成为一种常见的内在度量,但最近的工作质疑其作为质量指标的可靠性。 We investigate whether evaluating tokenizers on smaller models (350M parameters) reliably predicts their impact at larger scales (2.7B parameters).Through experiments with established tokenizers from widely-adopted language m

分析语言相似性对跨语言转移的影响:任务和输入表示

Analyzing the Effect of Linguistic Similarity on Cross-Lingual Transfer: Tasks and Input Representations Matter

跨语性转移是一种在低资源环境中增加NLP任务的培训数据量的流行方法。但是,确定包含哪些跨语性数据的最佳策略尚不清楚。先前的研究通常集中于一些语言家庭或一项任务的一小部分语言。这些发现如何扩展到多种多样的语言和任务仍然是一个悬而未决的问题。在这项工作中,我们通过分析来自各种语言家庭的263种语言的跨语化转移来为这个问题做出了贡献。此外,我们包括三个流行的NLP任务…

IEEE/CVF计算机视觉和模式识别会议(CVPR)2025

IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

苹果公司将赞助IEEE/CVF计算机视觉和模式识别会议(CVPR),该会议将于2025年6月11日至6月15日在田纳西州的纳什维尔举行。 CVPR是一年一度的计算机愿景活动,包括主会议,几个共同确定的研讨会和短期课程。以下是我们赞助的研讨会和活动的时间表。

提示耳语以改进逐字记录和端到端的错误检测

Prompting Whisper for Improved Verbatim Transcription and End-to-end Miscue Detection

*相同的贡献识别错误(即,在大声朗读时犯的错误)通常是通过将自动语音识别(ASR)转录与目标阅读文本进行比较而大声接触的。但是,当ASR不准确转录逐字化的语音时,事后方法的性能很差。为了改善当前阅读错误注释的方法,我们提出了一种新颖的端到端体系结构,该结构通过提示结合了目标阅读文本,并接受了改进的逐字记录和直接的错误检测。我们的贡献包括:首先证明…

蒸馏缩放法律

Distillation Scaling Laws

我们提出了一项蒸馏缩放法,该法律根据计算预算及其在学生和教师之间的分配来估算蒸馏模型性能。我们的发现通过为教师和学生启用计算最佳分配,以最大程度地提高学生表现,从而减轻与大规模蒸馏有关的风险。我们为两个关键情况提供了最佳的蒸馏食谱:当老师已经存在以及老师需要培训时。在涉及许多学生或现有教师的设置中,蒸馏的表现优于监督到计算水平的学习……

带有显式3D建模的世界一致的视频扩散

World-Consistent Video Diffusion With Explicit 3D Modeling

作为主导视觉内容生成的扩散模型,已经努力使这些模型适应多视图图像生成以创建3D内容。传统上,这些方法通过仅产生RGB框架来隐式学习3D一致性,这可以导致培训中的工件和效率低下。相比之下,我们建议在RGB框架并肩生成归一化坐标空间(NCS)框架。 NCS框架捕获每个像素的全局坐标,为3D一致性提供了强大的像素对应关系和明确的监督。另外,通过共同估计RGB和NCS框架…