随着生成AI的进步,在创建可以通过操作用户界面(UIS)来管理日常任务的自主代理方面正在越来越多的工作。尽管先前的研究已经研究了AI代理如何导航UI并了解UI结构的机制,但代理商及其自主行为的影响(尤其是那些可能是风险或不可逆的人)的影响不足。在这项工作中,我们研究了AI代理采取的移动UI行动的现实影响和后果。我们首先通过一系列…
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
以当前的视频问答(QA)需要模型来处理长途时间推理,第一人称视角以及诸如频繁的摄像机运动之类的专业挑战。本文系统地评估了QAEGO4DV2上的专有和开源多模型模型(MLLMS) - 源自Qaego4d的EgeCentric视频的精制数据集。使用零摄像机和CloseQA设置的零摄像和微调方法评估了四个流行的MLLM(GPT-4O,GEMINI-1.5-PRO,VIDEO-LALAVA-7B和QWEN2-VL-7B-INSTRUCT)。我们将QAEGO4DV2介绍给MitigateAnnotation Noise…
Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment
现有用于确保AI安全性的范例,例如护栏模型和对齐训练,通常会损害推理效率或发展灵活性。我们引入了解开的安全适配器(DSA),这是一个新颖的框架,通过将特定于任务优化的基本模型解耦来解决这些挑战。 DSA利用轻巧的适配器来利用基本模型的内部表示形式,从而实现了多种而灵活的安全功能,对推断成本的影响很小。从经验上讲,基于DSA的安全护栏的表现要优于相当优于……
STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
我们提出了Starflow,这是一种基于标准化流的可扩展生成模型,可在高分辨率图像合成中实现强大的性能。 Starflow的核心是变压器自回旋流量(TARFLOW),它结合了标准化流的表达能力与自回旋变压器的结构化建模功能。我们首先建立了TARFLOW的理论普遍性,用于建模连续分布。在这个基础的基础上,我们介绍了几种关键的建筑和算法创新,以显着提高可扩展性:(1)深刺……
Phonetically-Augmented Discriminative Rescoring for Voice Search Error Correction
端到端(E2E)自动语音识别(ASR)模型是使用配对的音频文本样本训练的,这些样品的获取昂贵,因为高质量的地面图数据需要人体注释。语音搜索应用程序(例如数字媒体播放器)利用ASR允许用户通过语音搜索而不是屏幕键盘。但是,在E2E ASR系统的训练数据中可能没有足够的代表或不足的电影标题,因此可能会受到较差的认可。在本文中,我们提出了一个语音校正系统,该系统由(a)基于…
Normalizing Flows are Capable Generative Models
标准化流(NFS)是基于连续输入的可能性模型。他们在密度估计和生成建模任务上都表现出了令人鼓舞的结果,但近年来受到了相对较少的关注。在这项工作中,我们证明了NFS比以前认为的强大。我们提出TARFLOW:一种简单且可扩展的体系结构,可实现高性能的NF模型。 TARFlow可以被认为是基于变压器的掩蔽自回旋流量(MAFS)的变体:它由图像补丁上的一堆自动回归变压器块组成……
语言模型(LMS)中的不确定性定量(UQ)是提高其安全性和可靠性的关键。评估通常使用诸如AUROC之类的指标来评估UQ方法(例如,负序列概率)与任务正确性函数(例如Rouge-l)的相关程度如何。我们表明,当UQ方法和正确性函数都被相同的因素偏置时,相同的偏见 - 系统扭曲评估。首先,我们正式证明任何互助非随机偏向AUROC排名,都会损害基准的完整性。其次,我们通过广泛的测试7来证实这是经验上发生的……
INRFlow: Flow Matching for INRs in Ambient Space
流量匹配模型已成为一种强大的方法,用于在图像或视频(例如3D点云甚至蛋白质结构)等不规则或非结构化数据等域上产生建模。这些模型通常在两个阶段进行训练:首先是训练数据压缩机,在随后的训练阶段,流动匹配生成模型在数据压缩机的潜在空间中进行了训练。这个两阶段的范式设定了跨数据域统一模型的障碍,因为手工制作的压缩机体系结构用于不同的数据模式。为此,我们…
Aligning LLMs by Predicting Preferences from User Writing Samples
适应人类的偏好对于创建提供个性化和有效互动的一致性LLM代理至关重要。最近的工作表明,LLM充当写作代理来推断用户偏好的描述。然后,代理对齐来自根据推论的偏好描述的条件。但是,现有方法通常会产生通用的偏好描述,而这些描述无法捕获人类偏好的独特性和个性化的性质。本文介绍了散文,这种方法旨在增强用户推论的偏好描述的精度…
Trade-offs in Data Memorization via Strong Data Processing Inequalities
最近的研究表明,培训大语言模型涉及大量培训数据的记忆。在敏感用户数据上培训培训时,这种记忆可能会导致侵犯隐私,从而激发了对数据记忆在学习中的作用的研究。在这项工作中,我们开发了一种通用方法来证明过度数据记忆的下限,该方法依赖于强烈的数据处理不平等和数据记忆之间的新联系。然后,我们证明了几个简单而自然的二进制分类问题在…
Variational Rectified Flow Matching
我们研究变异的整流流匹配,该框架通过建模多模式速度矢量场来增强经典的整流流匹配。在推理时,经典的整流流匹配“移动”样品通过沿速度向量场的集成求解普通的微分方程,从源分布到目标分布。在训练时,通过线性插值从源来绘制的耦合样品和一个随机从目标分布中绘制的耦合样品,从而学习了速度矢量场。这导致“地面真相”'速度…
Apple Machine Learning Research at CVPR 2025
苹果研究人员正在通过基础研究来推进AI和ML,并支持更广泛的研究社区并帮助加速该领域的进步,我们通过在会议上的出版和参与分享我们的大部分研究。本周,IEEE/CVF计算机视觉和模式识别会议(CVPR)将在田纳西州的纳什维尔举行。苹果很荣幸能再次参加社区的这一重要活动,并成为行业赞助商。在主要会议和相关的研讨会上,苹果研究人员将在许多…
Improve Vision Language Model Chain-of-thought Reasoning
视觉语言模型(VLMS)中的思考链(COT)推理对于改善无法释放性和可信赖性至关重要。但是,当前的培训食谱通常依赖于以统一理由为主导的ondatasets。在这项工作中,我们表明对简短答案的VLM进行训练会导致较差的推理任务,要求详细解释。为了解决这一局限性,我们提出了一个两阶段的培训后策略,该术时扩展了简短的答案数据以增强COT推理的用法。首先,用……
知觉语音质量维度描述了非典型语音和其他语音调制的关键特征。在这里,我们开发和评估了七个语音和语音维度的语音质量模型(可理解性,不精确的辅音,苛刻的声音,自然,单片,莫诺维奇和呼吸)。对公共语音可访问性(SAP)项目数据集进行了培训,其中有434位扬声器的11,184个样本,使用冷冻预培训模型的嵌入作为功能。我们发现,我们的探针在语音引起的探针既有强大的表现又有强烈的概括……
最近几代的边境语言模型引入了大型推理模型(LRMS),该模型在提供答案之前生成详细的思维过程。尽管这些模型可以提高推理基准的性能,但它们的基本功能,尺度属性和局限性仍然不足以理解。当前的评估主要是关于已建立的数学和编码基准的FO-CUS,强调了最终答案的准确性。但是,这种评估范式通常会遭受数据污染,并且不能为推理迹象提供见解。
Vision Foundation基础模型在大规模数据上进行了预训练,编码了现实世界概念的丰富表示形式,可以通过微调将其适用于下游任务。但是,一项任务的微调基础模型通常会导致概念忘记其他任务的问题。最新的良好微调方法旨在减轻忘记先验知识而不影响微调的性能。通常通过匹配原始和微调的模型权重或特征对来保留知识。但是,这样的点匹配可能太强了,而没有明确的意识……
Beyond Text Compression: Evaluating Tokenizers Across Scales
令牌设计师的设计显着影响语言模型性能,但是评估令牌质量仍然具有挑战性。尽管文本压缩已成为一种常见的内在度量,但最近的工作质疑其作为质量指标的可靠性。 We investigate whether evaluating tokenizers on smaller models (350M parameters) reliably predicts their impact at larger scales (2.7B parameters).Through experiments with established tokenizers from widely-adopted language m
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025
苹果公司将赞助IEEE/CVF计算机视觉和模式识别会议(CVPR),该会议将于2025年6月11日至6月15日在田纳西州的纳什维尔举行。 CVPR是一年一度的计算机愿景活动,包括主会议,几个共同确定的研讨会和短期课程。以下是我们赞助的研讨会和活动的时间表。