Apple机器学习研究领域信息情报检索

Apple的机器学习团队致力于进行机器学习和人工智能的最新研究。了解最新的进展。我们的机器学习研究团队合作交流,为每天改善数百万人生活的惊人体验作出贡献。

fastvlm:视觉语言模型的有效愿景

FastVLM: Efficient Vision encoding for Vision Language Models

缩放输入图像分辨率对于增强视觉语言模型(VLM)的性能至关重要,尤其是在文本丰富的图像理解任务中。但是,由于大量令牌和高度编码延迟,流行的视觉编码器(例如VIT)在高分辨率下效率低下。在不同的操作分辨率下,可以沿两个轴优化VLM的视觉编码器:减少编码延迟并最小化传递给LLM的视觉令牌的数量,从而降低整体延迟。基于对互动的综合效率分析…

与Gromov-Monge Gap

Disentangled Representational Learning with the Gromov-Monge Gap

从未标记的数据中学习分离的表示形式是机器学习的基本挑战。解决它可能会解散其他问题,例如概括,可解释性或公平性。尽管理论上要解决的问题非常具有挑战性,但在实践中通常通过先前的匹配实现了分解。此外,最近的作品表明,可以通过学习保留数据的几何特征(例如距离或点之间的角度)来利用几何考虑来增强先前的匹配方法。但是,匹配先前…

逐步扩散:基本教程

Step-by-Step Diffusion: An Elementary Tutorial

我们提供了一门关于扩散模型数学和机器学习流程匹配的可访问的第一门课程。我们的目标是尽可能简单地教授扩散,以最少的数学和机器学习先决条件,但足够的技术细节来理解其正确性。与大多数有关该主题的教程不同,我们既不采用变异自动编码器(VAE),也不采用随机微分方程(SDE)方法。实际上,对于核心思想,我们将不需要任何SDE,基于证据的降低器(ELBOS),Langevin Dynamics,甚至分数的概念。读者只需要…

国际学习表征会议(ICLR)2025

International Conference on Learning Representations (ICLR) 2025

苹果将赞助国际学习代表会议(ICLR),该会议将于2025年4月24日至28日在新加坡举行。 ICLR汇集了致力于进步深度学习的专业人员。

通过自回归模型适应的扩散语言模型

Scaling Diffusion Language Models via Adaptation from Autoregressive Models

扩散语言模型(DLM)已成为文本生成建模的有希望的新范式,有可能解决自回归(AR)模型的局限性。但是,与AR同行相比,当前的DLM的规模较小,并且缺乏对语言建模基准测试的公平比较。此外,从头开始的训练扩散模型仍然具有挑战性。鉴于开源AR语言模型的流行率,我们建议适应这些模型来构建文本扩散模型。我们演示了AR和扩散建模目标之间的联系以及…

飞镖:可扩展文本到图像生成的自动回归变压器

DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation

扩散模型已成为视觉产生的主要方法。他们是通过deno培训的马尔可夫工艺,该过程逐渐为输入增加了噪音。我们认为,马尔可夫的财产限制了该模型充分利用生成轨迹的能力,从而导致训练和推理期间效率低下。在本文中,我们提出了DART,这是一种基于变压器的模型,该模型统一自回归(AR)和非马克维亚框架内的扩散。飞镖迭代地将图像贴片在空间和光谱上使用与标准相同的架构相同的AR模型

天然多模型模型的缩放定律

Scaling Laws for Native Multimodal Models

建立可以通过多模式信号有效地感知世界的通用模型一直是一个长期目标。当前的方法涉及分别整合预训练的组件,例如将视觉编码器连接到LLMS和持续的多模式训练。尽管这种方法表现出显着的样本效率,但仍然是一个悬而未决的问题,这是否本质上是优越的。在这项工作中,我们重新审视了本地多模型(NMM)的建筑设计 - 从头开始​​训练的人 - 并进行广泛的……

ec-dit:使用自适应专家选择路由缩放扩散变压器

EC-DIT: Scaling Diffusion Transformers with Adaptive Expert-Choice Routing

扩散变压器已被广泛用于文本对图像合成。在将这些模型扩展到数十亿个参数显示出希望的同时,超越当前尺寸的缩放的有效性仍然没有充满挑战和具有挑战性。通过明确利用图像世代的计算异质性,我们开发了一个新的Experts(MOE)模型(MOE)模型(EC-DIT),用于具有专家选择路由的扩散变压器。 EC-DIT学会了适应性地优化分配的计算以了解输入文本并生成相应的图像补丁,从而实现异质性…

tis-dpo:直接偏好优化的令牌级别的重要性采样

TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization

直接偏好优化(DPO)由于其简单性和有效性而被广泛采用大型语言模型(LLMS)的偏好对齐。但是,DPO被推导为匪徒问题,其中整个响应被视为单臂,忽略了令牌之间的重要性差异,这可能会影响优化效率,并且使得难以实现最佳结果。在这项工作中,我们建议DPO的最佳数据在获胜和失去响应方面的每个代币都具有相同的预期奖励,因为令牌重要性没有差异。但是,由于…

comotion:并发多人3D运动

CoMotion: Concurrent Multi-Person 3D Motion

我们介绍了一种从单眼相机流中检测和跟踪多个人的详细3D姿势的方法。我们的系统在充满困难的姿势和遮挡的拥挤场景中保持了时间连贯的预测。我们的模型既可以执行强大的人均检测,又可以进行学习的姿势更新,以从框架到框架跟踪人们。 Poses并没有直接从新的输入图像中更新,而不是跨时间匹配检测,该图像可以通过遮挡在线跟踪。我们在许多图像和视频数据集上培训,以利用伪标记的注释来产生…

focallens:指令调整启用零射击条件图像表示

FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations

本文在ICLR 2025的野外基础模型的研讨会上接受了本文的理解本质上是上下文 - 我们在图像中关注的内容取决于手头的任务。例如,考虑到一个人拿着一束鲜花的人的图像,我们可能会根据感兴趣的背景而专注于他们的衣服或花的类型。但是,大多数现有的图像编码范式代表图像作为固定的通用特征向量,可忽视优先考虑不同下游用例的不同视觉信息的潜在需求。在…

了解使用差异隐私的苹果智能的总趋势

Understanding Aggregate Trends for Apple Intelligence Using Differential Privacy

在苹果公司,我们认为隐私是人类的基本权利。我们相信,在保护其隐私的同时为用户提供了丰富的经验。多年来,我们一直使用诸如差异隐私之类的技术作为我们选择装置分析计划的一部分。这使我们可以深入了解产品的使用方式,因此我们可以通过防止Apple从这些用户中查看个人级别数据来改进它们,同时保护用户隐私。在Apple Intelligence中也存在同样的需求,同样需要了解使用使用,同时保护隐私。我们的原则之一是苹果没有使用我们的用户……

mm-ego:朝着以自我为中心的多模式LLMS

MM-Ego: Towards Building Egocentric Multimodal LLMs

这项研究旨在全面探索建立以自我为中心视频理解的多模式基础模型。为了实现这一目标,我们在三个方面工作。首先,由于缺乏质量为中心的视频理解的质量检查数据,因此我们将自动生成7m高质量的质量质量样本,用于基于人类通知数据的ego4d的自我中心视频。这是最大的中心QA数据集之一。其次,我们通过629个视频和7,026个问题来贡献一个具有挑战性的QA基准,以评估模型的识别能力和…

语言模型比他们所显示的更多:从模型的角度探索幻觉

Language Models Know More Than They Show: Exploring Hallucinations From the Model's Viewpoint

大型语言模型(LLM)通常会产生错误,包括事实上的不准确性,偏见和推理失败,共同称为“幻觉”。最近的研究表明,LLMS的内部状态编码有关其产出真实性的信息,并且可以利用此信息来检测错误。在这项工作中,我们表明LLMS的内部表示与以前所认识的更多有关真实性的信息要多。我们首先发现真实信息集中在特定的令牌上,并利用这一点……

私人查找二阶固定点

Adaptive Batch Size for Privately Finding Second-order Stationary Points

在不同的隐私约束下找到一阶固定点(FOSP)和二阶固定点(SOSP)之间存在差距,而且尚不清楚私人发现SOSP是否比找到FOSP更具挑战性。具体而言,Ganesh等人。 (2023)声称可以在α= o〜(1n1/3+(dnϵ)3/7)\ alpha = \ tilde {o}(\ frac {1} {n^{n^{1/3}}}+(\(\) frac {\ sqrt {d}} {n \ epsilon})^{3/7})α= o〜(n1/31+(nϵd)3/7),其中nnn是数据集大小,ddd是维度,ϵ \ epsilonϵ是差分隐私参数。

通过传输激活来控制语言和扩散模型

Controlling Language and Diffusion Models by Transporting Activations

大型生成模型变得越来越有能力,并且更广泛地部署到电力生产应用程序中,但是让这些模型确切地产生所需的东西仍然具有挑战性。对这些模型的输出的细粒度控制对于满足用户的期望和减轻潜在的滥用非常重要,从而确保了模型的可靠性和安全性。为了解决这些问题,Apple Machine Learning研究人员开发了一种新技术,该技术具有模态性敏捷性,并通过可忽略的计算开销对模型的行为进行了精细的控制,而…

简单的回流:快速流模型的改进技术

Simple ReFlow: Improved Techniques for Fast Flow Models

扩散和流程匹配模型实现了显着的生成性能,但以许多抽样步骤的成本为代价,这会减慢推理并将适用性限制在关键任务中。回流过程可以通过拉直产生轨迹加速采样。但是,反流是一种迭代过程,通常需要对模拟数据进行培训,并导致样品质量降低。为了减轻样品恶化,我们检查了反流的设计空间,并在先前的启发式实践中突出了潜在的陷阱。然后,我们提出了七个训练动态的改进……

通过群集以下采样

Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling

专业语言模型(LMS)专注于特定的任务或域通常超过相同大小的通用LMS。但是,预算这些模型所需的专业数据仅适用于大多数任务。在这项工作中,我们改用大型通才训练集建立了专业模型。我们通过有限的特定领域数据的指导调整通才数据的训练分布。我们探索了几种方法,重要性采样脱颖而出。此方法将通才数据集和这些簇中的样本群集成……