Compact Neural TTS Voices for Accessibility
当代无障碍应用的文本转语音解决方案通常可分为两类:(i) 基于设备的统计参数语音合成 (SPSS) 或单元选择 (USEL) 和 (ii) 基于云的神经 TTS。SPSS 和 USEL 以牺牲自然度和音频质量为代价,提供低延迟和低磁盘占用。基于云的神经 TTS 系统提供明显更好的音频质量和自然度,但在延迟和响应性方面有所退步,使得它们不适用于实际应用。最近,神经 TTS 模型被部署到……
机器翻译 (MT) 正在经历范式转变,基于微调大型语言模型 (LLM) 的系统与专门为翻译任务训练的传统编码器-解码器模型相比,竞争力越来越强。然而,基于 LLM 的系统产生幻觉的风险更高,这会严重损害用户的信任和安全。大多数关于缓解幻觉的先前研究都集中在传统的 MT 模型上,解决方案涉及事后缓解 - 检测幻觉翻译并重新翻译。虽然这种方法有效,但……
Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models
事实证明,扩展语言模型的容量是提高性能和解锁新功能的可靠方法。容量主要由两个维度定义:模型参数的数量和每个示例的计算量。虽然扩展通常涉及增加两者,但这些因素之间的精确相互作用及其对整体容量的综合贡献仍未完全了解。我们在稀疏混合专家 (MoE) 的背景下探索了这种关系,它允许扩展参数数量而不按比例增加……
Provable Uncertainty Decomposition via Higher-Order Calibration
我们给出了一种原则性方法,用于将模型的预测不确定性分解为具有明确语义的随机和认知组件,将它们与真实世界的数据分布相关联。虽然文献中的许多作品都提出了这样的分解,但它们缺乏我们提供的正式保证类型。我们的方法基于高阶校准的新概念,它将普通校准推广到高阶预测器的设置,这些预测器在每个点上预测标签分布的混合。我们展示了如何测量以及实现高阶校准……
EMOTION: Expressive Motion Sequence Generation for Humanoid Robots with In-Context Learning
本文介绍了一种名为 EMOTION 的框架,用于在人形机器人中生成富有表现力的运动序列,从而增强它们进行类似人类的非语言交流的能力。面部表情、手势和身体动作等非语言线索在有效的人际互动中起着至关重要的作用。尽管机器人行为取得了进步,但现有方法往往无法模仿人类非语言交流的多样性和微妙性。为了解决这一差距,我们的方法利用大型语言模型 (LLM) 的上下文学习能力来……
ELEGNT: Expressive and Functional Movement Design for Non-Anthropomorphic Robot
在人际交往中,姿势、手势和凝视等非语言行为对于有意识和无意识地传达内部状态至关重要。为了让机器人与人类更自然地互动,机器人运动设计同样应该将表达品质(例如意图、注意力和情感)与传统的功能考虑因素(如任务完成、空间限制和时间效率)结合起来。在本文中,我们介绍了一种灯状机器人的设计和原型设计,该机器人探索了运动中功能性和表达目标之间的相互作用……
Mapping Cells Through Time and Space With Moscot
单细胞基因组学技术能够在时间和空间维度上对数百万个细胞进行多模态分析。实验限制阻碍了在其原生时间动态或空间组织环境中测量包罗万象的细胞状态。最佳传输理论已成为克服此类限制的有力工具,能够恢复原始细胞环境。然而,目前大多数可用的算法实现都没有跟上数据集复杂性不断增加的步伐,因此当前的方法无法结合多模式……
DSplats: 3D Generation by Denoising Splats-Based Multiview Diffusion Models
生成高质量的 3D 内容需要能够学习复杂场景及其中真实物体的稳健分布的模型。最近基于高斯的 3D 重建技术通过以前馈方式预测 3D 高斯函数,在从稀疏输入图像中恢复高保真 3D 资产方面取得了令人印象深刻的结果。然而,这些技术通常缺乏扩散模型提供的广泛先验和表现力。另一方面,已成功应用于多视图图像去噪的 2D 扩散模型显示出生成广泛...
On the Modeling Capabilities of Large Language Models for Sequential Decision Making
大型预训练模型在不同模式下的推理和规划任务中表现出越来越好的性能,为利用它们解决复杂的顺序决策问题提供了可能性。在本文中,我们研究了大型语言模型 (LLM) 在各种交互领域中进行强化学习 (RL) 的能力。我们评估了它们制定决策策略的能力,无论是直接通过生成动作,还是间接通过首先生成奖励模型来训练具有 RL 的代理。我们的结果表明,即使没有……
本文介绍了一种使用大型语言模型 (LLM) 进行端到端自动语音识别 (E2E-ASR) 的有效解码方法。虽然浅层融合是将语言模型纳入 E2E-ASR 解码的最常见方法,但我们在 LLM 方面面临两个实际问题。 (1) LLM 推理在计算上成本高昂。 (2) ASR 模型和 LLM 之间可能存在词汇不匹配。为了解决这种不匹配,我们需要重新训练 ASR 模型和/或 LLM,这在最好的情况下很耗时,而且在许多情况下是不可行的。我们提出了“延迟融合”,它应用 LLM 分数……
Interpreting CLIP: Insights on the Robustness to ImageNet Distribution Shifts
稳健模型和非稳健模型的区别是什么?虽然对于 ImageNet 分布变化,已经表明这种稳健性差异可以主要追溯到训练数据的差异,但到目前为止,尚不清楚这在模型学习方面意味着什么。在这项工作中,我们通过探测具有各种主干(ResNets 和 ViTs)和预训练集(OpenAI、LAION-400M、LAION-2B、YFCC15M、CC12M 和 DataComp)的 16 个稳健零样本 CLIP 视觉编码器的表示空间,并将它们与较少的表示空间进行比较来弥合这一差距……
Controlling Language and Diffusion Models by Transporting Activations
大型生成模型的功能不断增强,部署范围也越来越广,这引发了人们对其可靠性、安全性和潜在滥用的担忧。为了解决这些问题,最近的研究提出通过控制模型激活来控制模型生成,以便有效地诱导或防止生成输出中出现概念或行为。在本文中,我们介绍了激活传输 (AcT),这是一个由最佳传输理论指导的激活控制通用框架,它概括了许多以前的激活控制工作。AcT 是……
多语言知识图谱 (KG) 为各种 NLP 应用程序提供高质量的关系和文本信息,但它们通常不完整,尤其是在非英语语言中。先前的研究表明,结合不同语言的 KG 信息有助于知识图谱完成 (KGC)(预测实体之间缺失关系的任务)或知识图谱增强 (KGE)(预测实体缺失的文本信息的任务)。尽管之前的研究已经将 KGC 和 KGE 视为独立的任务,但我们假设它们是……
指纹代码是证明差分隐私下限的重要工具。它们已用于证明几个基本问题的严格下限,尤其是在“低准确度”制度下。然而,与重构/差异方法不同,它们更适合证明最坏情况下限,用于自然产生于指纹代码构造的查询集。在这项工作中,我们提出了一个证明指纹类型下限的通用框架,该框架允许我们根据查询集的几何形状定制该技术。我们的方法允许我们……
SLiCK: Exploiting Subsequences for Length-Constrained Keyword Spotting
在资源受限的边缘设备上进行用户定义的关键字识别具有挑战性。但是,关键字通常受最大关键字长度的限制,这在以前的工作中基本上没有得到充分利用。我们对关键字长度分布的分析表明,用户定义的关键字识别可以视为长度受限的问题,从而无需对可变文本长度进行聚合。这导致了我们提出的高效关键字识别方法 SLiCK(利用子序列进行长度受限的关键字识别)。我们进一步引入了子序列级匹配方案来……
Privacy-Computation Trade-offs in Private Repetition and Metaselection
私有重复算法将成功概率为恒定的差分私有算法作为输入,并将其提升为成功概率较高的算法。这些算法与与众多私有算法中的最佳算法竞争的私有元选择算法以及与私有学习算法的最佳超参数设置竞争的私有超参数调整算法密切相关。这些任务的现有算法要么在隐私成本上付出了巨大的开销,要么在计算成本上付出了巨大的开销。在这项工作中,我们展示了强下限......
我们引入了形状标记,这是一种连续、紧凑且易于集成到机器学习模型中的 3D 表示。形状标记用作条件向量,表示 3D 流匹配模型中的形状信息。此流匹配模型经过训练,可以近似对应于集中在 3D 形状表面上的 delta 函数的概率密度函数。通过将形状标记整合到各种机器学习模型中,我们可以生成新形状、将图像转换为 3D、将 3D 形状与文本和图像对齐,并直接在变量处渲染形状……
Accelerating LLM Inference on NVIDIA GPUs with ReDrafter
加速 LLM 推理是一个重要的 ML 研究问题,因为自回归 token 生成计算成本高且相对较慢,而提高推理效率可以减少用户的延迟。除了持续努力加速 Apple 芯片上的推理之外,我们最近在加速 NVIDIA GPU 的 LLM 推理方面取得了重大进展,该 GPU 广泛用于整个行业的生产应用程序。今年早些时候,我们发布并开源了 Recurrent Drafter (ReDrafter),这是一种新颖的推测解码方法,达到了最先进的水平……