随着儿童越来越多地在设备上使用媒体,家长们正在寻找这种使用方式可以支持学习和成长的方法,尤其是在社交情感学习等领域。我们推出了 eaSEL,该系统 (a) 通过生成反思活动将社交情感学习 (SEL) 课程融入儿童视频消费中,(b) 促进亲子之间围绕数字媒体的讨论,而无需共同观看视频。我们对系统在转录中检测社交情感时刻和生成高质量 SEL 的能力进行了技术评估……
Reinforcement Learning for Long-Horizon Interactive LLM Agents
交互式数字代理 (IDA) 利用有状态数字环境的 API 来响应用户请求执行任务。虽然由指令调整的大型语言模型 (LLM) 驱动的 IDA 可以对多步骤交换中接口调用的反馈做出反应,但它们尚未在各自的数字环境中接受过训练。之前的方法在 AppWorld 等复杂的基准测试中完成的任务不到一半。我们提出了一种强化学习 (RL) 方法,可直接在目标环境中训练 IDA。我们将这种训练形式化为部分可观察的马尔可夫模型……
Adaptive Training Distributions with Scalable Online Bilevel Optimization
在网络规模语料库上进行预训练的大型神经网络是现代机器学习的核心。在这种范式中,大型异构预训练数据的分布很少与应用领域的分布相匹配。这项工作考虑在拥有反映目标测试条件的少量数据样本的情况下修改预训练分布。我们提出了一种算法,该算法受到最近将此设置表述为在线双层优化问题的启发。考虑到可扩展性,我们的算法优先考虑在可能... 的训练点计算梯度。
Step-by-Step Reasoning for Math Problems via Twisted Sequential Monte Carlo
增强大型语言模型 (LLM) 的多步推理能力一直是一个持续的挑战。最近,验证已显示出通过评估生成的输出来提高解决方案一致性的希望。然而,当前的验证方法存在采样效率低下的问题,需要大量样本才能达到令人满意的性能。此外,训练有效的验证者通常依赖于广泛的过程监督,而这需要高昂的成本。在本文中,我们通过引入一种基于 Twisted 的新型验证方法来克服这些限制...
Compact Neural TTS Voices for Accessibility
当代无障碍应用的文本转语音解决方案通常可分为两类:(i) 基于设备的统计参数语音合成 (SPSS) 或单元选择 (USEL) 和 (ii) 基于云的神经 TTS。SPSS 和 USEL 以牺牲自然度和音频质量为代价,提供低延迟和低磁盘占用。基于云的神经 TTS 系统提供明显更好的音频质量和自然度,但在延迟和响应性方面有所退步,使得它们不适用于实际应用。最近,神经 TTS 模型被部署到……
机器翻译 (MT) 正在经历范式转变,基于微调大型语言模型 (LLM) 的系统与专门为翻译任务训练的传统编码器-解码器模型相比,竞争力越来越强。然而,基于 LLM 的系统产生幻觉的风险更高,这会严重损害用户的信任和安全。大多数关于缓解幻觉的先前研究都集中在传统的 MT 模型上,解决方案涉及事后缓解 - 检测幻觉翻译并重新翻译。虽然这种方法有效,但……
Provable Uncertainty Decomposition via Higher-Order Calibration
我们给出了一种原则性方法,用于将模型的预测不确定性分解为具有明确语义的随机和认知组件,将它们与真实世界的数据分布相关联。虽然文献中的许多作品都提出了这样的分解,但它们缺乏我们提供的正式保证类型。我们的方法基于高阶校准的新概念,它将普通校准推广到高阶预测器的设置,这些预测器在每个点上预测标签分布的混合。我们展示了如何测量以及实现高阶校准……
Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models
事实证明,扩展语言模型的容量是提高性能和解锁新功能的可靠方法。容量主要由两个维度定义:模型参数的数量和每个示例的计算量。虽然扩展通常涉及增加两者,但这些因素之间的精确相互作用及其对整体容量的综合贡献仍未完全了解。我们在稀疏混合专家 (MoE) 的背景下探索了这种关系,它允许扩展参数数量而不按比例增加……
EMOTION: Expressive Motion Sequence Generation for Humanoid Robots with In-Context Learning
本文介绍了一种名为 EMOTION 的框架,用于在人形机器人中生成富有表现力的运动序列,从而增强它们进行类似人类的非语言交流的能力。面部表情、手势和身体动作等非语言线索在有效的人际互动中起着至关重要的作用。尽管机器人行为取得了进步,但现有方法往往无法模仿人类非语言交流的多样性和微妙性。为了解决这一差距,我们的方法利用大型语言模型 (LLM) 的上下文学习能力来……
ELEGNT: Expressive and Functional Movement Design for Non-Anthropomorphic Robot
在人际交往中,姿势、手势和凝视等非语言行为对于有意识和无意识地传达内部状态至关重要。为了让机器人与人类更自然地互动,机器人运动设计同样应该将表达品质(例如意图、注意力和情感)与传统的功能考虑因素(如任务完成、空间限制和时间效率)结合起来。在本文中,我们介绍了一种灯状机器人的设计和原型设计,该机器人探索了运动中功能性和表达目标之间的相互作用……
Mapping Cells Through Time and Space With Moscot
单细胞基因组学技术能够在时间和空间维度上对数百万个细胞进行多模态分析。实验限制阻碍了在其原生时间动态或空间组织环境中测量包罗万象的细胞状态。最佳传输理论已成为克服此类限制的有力工具,能够恢复原始细胞环境。然而,目前大多数可用的算法实现都没有跟上数据集复杂性不断增加的步伐,因此当前的方法无法结合多模式……
DSplats: 3D Generation by Denoising Splats-Based Multiview Diffusion Models
生成高质量的 3D 内容需要能够学习复杂场景及其中真实物体的稳健分布的模型。最近基于高斯的 3D 重建技术通过以前馈方式预测 3D 高斯函数,在从稀疏输入图像中恢复高保真 3D 资产方面取得了令人印象深刻的结果。然而,这些技术通常缺乏扩散模型提供的广泛先验和表现力。另一方面,已成功应用于多视图图像去噪的 2D 扩散模型显示出生成广泛...
本文介绍了一种使用大型语言模型 (LLM) 进行端到端自动语音识别 (E2E-ASR) 的有效解码方法。虽然浅层融合是将语言模型纳入 E2E-ASR 解码的最常见方法,但我们在 LLM 方面面临两个实际问题。 (1) LLM 推理在计算上成本高昂。 (2) ASR 模型和 LLM 之间可能存在词汇不匹配。为了解决这种不匹配,我们需要重新训练 ASR 模型和/或 LLM,这在最好的情况下很耗时,而且在许多情况下是不可行的。我们提出了“延迟融合”,它应用 LLM 分数……
On the Modeling Capabilities of Large Language Models for Sequential Decision Making
大型预训练模型在不同模式下的推理和规划任务中表现出越来越好的性能,为利用它们解决复杂的顺序决策问题提供了可能性。在本文中,我们研究了大型语言模型 (LLM) 在各种交互领域中进行强化学习 (RL) 的能力。我们评估了它们制定决策策略的能力,无论是直接通过生成动作,还是间接通过首先生成奖励模型来训练具有 RL 的代理。我们的结果表明,即使没有……
Interpreting CLIP: Insights on the Robustness to ImageNet Distribution Shifts
稳健模型和非稳健模型的区别是什么?虽然对于 ImageNet 分布变化,已经表明这种稳健性差异可以主要追溯到训练数据的差异,但到目前为止,尚不清楚这在模型学习方面意味着什么。在这项工作中,我们通过探测具有各种主干(ResNets 和 ViTs)和预训练集(OpenAI、LAION-400M、LAION-2B、YFCC15M、CC12M 和 DataComp)的 16 个稳健零样本 CLIP 视觉编码器的表示空间,并将它们与较少的表示空间进行比较来弥合这一差距……
Controlling Language and Diffusion Models by Transporting Activations
大型生成模型的功能不断增强,部署范围也越来越广,这引发了人们对其可靠性、安全性和潜在滥用的担忧。为了解决这些问题,最近的研究提出通过控制模型激活来控制模型生成,以便有效地诱导或防止生成输出中出现概念或行为。在本文中,我们介绍了激活传输 (AcT),这是一个由最佳传输理论指导的激活控制通用框架,它概括了许多以前的激活控制工作。AcT 是……
多语言知识图谱 (KG) 为各种 NLP 应用程序提供高质量的关系和文本信息,但它们通常不完整,尤其是在非英语语言中。先前的研究表明,结合不同语言的 KG 信息有助于知识图谱完成 (KGC)(预测实体之间缺失关系的任务)或知识图谱增强 (KGE)(预测实体缺失的文本信息的任务)。尽管之前的研究已经将 KGC 和 KGE 视为独立的任务,但我们假设它们是……
指纹代码是证明差分隐私下限的重要工具。它们已用于证明几个基本问题的严格下限,尤其是在“低准确度”制度下。然而,与重构/差异方法不同,它们更适合证明最坏情况下限,用于自然产生于指纹代码构造的查询集。在这项工作中,我们提出了一个证明指纹类型下限的通用框架,该框架允许我们根据查询集的几何形状定制该技术。我们的方法允许我们……