SpeakStream: Streaming Text-to-Speech with Interleaved Data
With the increasing integration of speech front-ends and large language models (LLM),there is a need to explore architectures that integrate these modalities.While end-to-end models have been explored extensively, cascaded models that stream outputs from LLMs to TTS seem to be oddly under-explored,
Foundation Model Hidden Representations for Heart Rate Estimation from Auscultation
听诊,尤其是心脏声音,是一种提供必不可少的生命体征信息的无侵蚀性技术。非常肯定地,已经提出了自我监督的声学代表模型(FMS),以提供基于洞察力的奥斯科群体基于Acouttics的生命体征。但是,已经探索了这些预训练的FM表示中的听诊的程度。在这项工作中,使用公开可用的Phonocardioram(PCG)数据集和心率(HR)估计模型,我们对六个声学代表FMS进行了层次调查:Hubert:hubert,wav2vec2…
Interleaved Reasoning for Large Language Models via Reinforcement Learning
长期思考链(COT)显着增强了大型语言模型(LLM)的推理能力。但是,广泛的推理痕迹导致效率低下和增加时间(TTFT)的增加。我们提出了一种新颖的培训范式,该训练范式使用加固学习(RL)指导推理LLMS以交织和回答多跳的问题。我们观察到,模型本质上具有执行交织的推理的能力,可以通过RL进一步增强。我们引入了一个简单而有效的基于规则的奖励,以激励正确的中间步骤……
CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling
混合物(MOE)模型对于在控制推理成本的同时,对于缩放模型的容量至关重要。在将MOE集成到诸如夹子之类的多模型中,可以提高性能,但众所周知,培训这些模型具有挑战性且昂贵。我们提出了剪辑剪辑(剪辑),这是一种有效的替代培训策略,可将预先训练的密集夹模型转换为稀疏的MoE体系结构。通过对各种环境和辅助损失进行广泛的实验,我们证明了剪辑可显着降低训练的复杂性和成本。值得注意的是,我们稀疏的剪辑B/16…
SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models
随着Largelanguage模型(LLM)规模的快速扩展,使跨多个计算单元的有效分布推理变得越来越重要。但是,来自流行的分布式促进技术(例如张量并行主义)的沟通开销构成了实现可伸缩性和低潜伏期的重大挑战。因此,我们引入了一种新颖的技术,同步点降(SPD),以通过选择性地降低注意力输出的同步性来减少张量并行性中的通信开销。详细说明,我们首先提出了一个……
What Makes for a Good Stereoscopic Image?
本文在CV4Metaverse研讨会上接受了CVPR2025。在虚拟现实(VR)头戴式耳机中的快速进步,有效地测量了立体体验(SQOE)对于提供沉浸式和舒适的3D体验至关重要。但是,大多数现有的立体声指标都集中在观看体验的孤立方面,例如视觉不适或图像质量,并且传统上面临着数据限制。为了解决这些差距,我们提出范围(立体内容偏好评估),这是一个由真实和合成的立体图像组成的新数据集……
Cubify Anything: Scaling Indoor 3D Object Detection
我们考虑了从商品手持设备中获取的单个RGB(-d)帧的室内3D对象检测。我们试图在数据和建模方面显着提高现状。首先,我们确定现有数据集对对象的规模,准确性和多样性有重大限制。结果,我们介绍了Cubify-任何1M(CA-1M)数据集,该数据集在超过1K的高度精确的激光扫描场景上详尽地标记了超过400K的3D对象,并将其接近完美的注册标记为超过3.5k手持式手持式捕获。接下来,我们建立Cubify Transformer…
Humanoid Policy ~ Human Policy
针对人形机器人的培训操纵政策会涉及数据,从而增强了其跨任务和平台的稳健性和泛化。但是,仅从机器人示范中学习是劳动密集型的,需要昂贵的远程操作数据收获,这很难扩展。本文研究了更可扩展的数据源,即中心的人类示范,以作为机器人学习的跨体型培训数据。我们从数据和建模观点来减轻人形生物与人类之间的实施差距。我们收集了一个以egipentric任务为导向的数据集(PH2D)…
当前的大型语言模型(LLMS)主要是用英语设计为主要语言的,即使是多语言的少数语言也倾向于表现出强烈的以英语为中心的偏见。就像在学习第二语言时可能会产生尴尬表情的演讲者一样,LLM通常会以非英语语言产生不自然的输出,反映了词汇和语法中以英语为中心的模式。尽管这个问题很重要,但多语言LLM输出的自然性受到了有限的关注。在本文中,我们通过引入新颖的自动……
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
我们提出了StreamBridge,这是一个简单而有效的框架,无缝地将离线视频插件转换为具有流能力的模型。它解决了将现有模型调整为在线方案的两个基本挑战:(1)有限的实时理解能力有限,以及(2)缺乏主动的响应机制。具体而言,StreamBridge结合了(1)一个内存缓冲区,并结合了一个圆形截止的压缩策略,支持长篇小说多转变的交互,以及(2)一个可以毫不费力地集成到现有的…
Matrix3D: Large Photogrammetry Model All-in-One
我们提出了Matrix3d,这是一种执行多个摄影测量子任务的统一模型,包括使用相同的模型使用姿势估计,深度预测和新型视图合成。 MATRIX3D利用多模式扩散变压器(DIT)来整合几种模态的转换,例如图像,相机参数和深度图。 MATRIX3D大规模多模式训练的关键在于结合面具学习策略。即使有部分完整的数据,例如图像置态和图像深度对的双模式数据也可以实现全模式模型训练……
Classifier-Free Guidance is a Predictor-Corrector
我们研究了无分类器指导(CFG)的理论基础。 CFG是文本对图像扩散模型的条件采样的主要方法,但与扩散的其他方面不同,它仍然保持在摇摇欲坠的理论基础上。在本文中,我们通过证明CFG与DDPM(Ho等,2020)和DDIM(Song等,2021)的相互作用来反驳共同的误解,并且CFG都不会产生gamma驱动的分布P(x | c)^γp(x)^γp(x)^{1- = {1-γ}。然后,我们通过证明它是一种预测器 - 矫正器方法来阐明CFG的行为(Song等,2020)…
Mechanisms of Projective Composition of Diffusion Models
我们研究了扩散模型中组成的理论基础,特别着眼于分布外的外推和长度将军。先前的工作表明,通过线性得分组合组成分布可以实现有希望的结果,包括在某些情况下(Du等,2023; Liu等,2022)。但是,我们对这些构图如何以及为什么起作用的理论理解仍然不完整。实际上,甚至还不清楚组成的“工作”意味着什么。本文开始解决这些基本差距。我们从…
Local Pan-Privacy for Federated Analytics
Pan-Privacy。 (2010年)作为设计私人分析系统的方法,该系统在面对暴露系统内部状态的入侵中保留其隐私属性。在联邦遥测应用程序中,我们研究了当地的泛滥,在该广场上应保留在一再对当地国家的未经通知的侵犯下保留的隐私。我们考虑了监视联合系统中事件计数的问题,在该系统中,即使在该设备上的入侵者中,也应隐藏在本地设备上的事件。我们表明,在合理的约束下,…
Improved Sample Complexity for Private Nonsmooth Nonconvex Optimization
我们研究了既不光滑也不平稳的随机目标和经验目标的差异私有(DP)优化算法,并提出了返回戈德斯坦 - 安置点具有样本复杂性界限的方法,这些方法是改善现有工作的样本复杂性。 (α,β)(\ alpha,\ beta)(α,β) - 只要数据集大小…
An LLM-Based Approach to Review Summarization on the App Store
评分和评论是探索应用程序商店中应用程序的用户的宝贵资源,提供了有关其他人如何体验应用程序的见解。通过iOS 18.4中的评论摘要,用户可以快速获得其他用户对应用程序的看法的高级概述,同时仍然可以选择介绍个人评论以获取更多详细信息。此功能由一个新颖的基于LLM的新型系统提供动力,该系统会定期汇总用户评论。我们生成评论摘要的目标是确保它们具有包容性,平衡并准确地反映用户的声音。到…
随着统计分析对科学,工业和社会的核心越来越重要,因此越来越需要确保其结果的正确性。可以通过复制整个分析来验证近似正确性,但是我们可以在不复制的情况下验证吗?在最新工作的基础上,我们研究了允许概率验证者确定分析结果的证明系统近似正确,同时绘制较少的样本和使用较少的计算资源来复制分析所需的计算资源。我们专注于分发测试问题:验证…
Apple Machine Learning Research at ICLR 2025
苹果研究人员正在通过基础研究来推进机器学习(ML)和AI,从而提高了世界对这项技术的理解,并有助于重新定义它的可能性。为了支持更广泛的研究社区并帮助加速该领域的进步,我们通过出版物,开源资源和会议的参与分享我们的大部分研究。本周,第十三国际学习代表会议(ICLR)将在新加坡举行。 ICLR汇集了深度学习和代表性应用的主要专家……