REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
当前大多数视觉-语言-动作 (VLA) 模型(例如 OpenVLA、π0、RT-2 和 RDT-1B)都是“单一的”。这意味着它们生成原始运动命令或非常短的动作序列,而不将行为组织成可重用的、定义明确的抽象。因此,这些模型在长期(多步骤)任务上表现不佳,并且很难解释它们学到的东西。现有的发现技能的方法通常避免了决定两个动作序列何时“行为等效”的核心问题。例如,AtomicVLA 和 AtomSkill 通过...分组动作序列
Agent Seer: Synthesizing Scenarios from Specification Understanding
评估使用外部工具的 AI 代理需要真实的测试场景,以捕获从业者如何组合工具并迭代对话轮次。手动构建此类场景需要深厚的领域专业知识,无法跨工具生态系统扩展,并且生成无法跟踪不断发展的 API 的静态基准。我们观察到工具规范(函数名称、自然语言描述和类型化参数模式)已经编码了足够的语义信息,可以合成真实的评估场景,而无需手动管理或实时工具执行。先知特工…
现代人工智能系统正在被部署在医学、科学和法律等复杂领域,根据观察到的证据,这些领域通常没有一个正确的答案。当新证据出现时,此类系统必须能够代表和更新关于世界的不确定信念,以做出理性决策。我们引入了将法学硕士作为信息处理规则进行研究的新技术,并利用信息处理差距(与贝叶斯更新的偏差)来研究法学硕士如何根据证据更新其概率信念的内部(内)一致性。我们广泛的实验评估...
From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
为开放域问答设计有效的奖励信号具有挑战性,因为高质量的响应必须同时满足答案质量的多个方面,而这些方面很难用整体标量目标来捕获。我们引入了一个基于评分标准的奖励框架,该框架根据检索到的证据生成特定于查询的评分标准,并分解为多个质量维度,从而在训练后提供细粒度的监督。对三个评估轴(构图、基础和遵循指令)进行平均,我们的方法改进了......
PROOF-Gen: From Optimized Data to Better Distillation
在教师生成轨迹上的监督微调是将工具调用能力蒸馏到可部署模型的标准第一阶段。推动已发布工具调用代理的后训练流水线以每日或每周的节奏重新运行此阶段。
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
大型语言模型的最新进展加剧了在有限推理预算内对高效可部署模型的需求。与从头开始训练目标规模模型相比,结构化剪枝管道在令牌效率方面显示出潜力。
Luce: Relightable Gaussians for 3D Asset Generation
高保真图像到3D生成需要一种能够同时捕捉几何形状和外观的3D表示。为了支持重新照明和集成到标准渲染管道中,该表示应包括基于物理的渲染(PBR)模态。
STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
能够理解、推理和生成交错文本-图像序列的统一多模态模型在结构上仍然分散:现有方法要么通过离散标记化牺牲视觉保真度,要么通过组合不同的模态施加结构不对称性。
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
多模态大语言模型越来越多地使用视觉思维链 (Visual CoT) 来推理空间、时间和具体环境。通过生成中间推理图像,Visual CoT 为视觉预见提供了直观的机制,但引入了大量的推理开销,这对于主动视频推理来说尤其成问题。我们询问模型是否可以在训练过程中学会视觉思考,同时在推理时直接进行推理。我们引入内部化视觉思维(IVT),这是一种联合优化文本预测和……的训练后框架。
语码转换 (CS),即同一话语中的不同语言,由于 CS 训练数据有限,给自动语音识别 (ASR) 带来了重大挑战。本文首次将迭代伪标记训练方法应用于 CS-ASR,证明了其在利用未标记数据来提高 CS-ASR 性能方面的有效性。该方法包括三个阶段:伪标签生成、两阶段双语模型训练和迭代改进。它首先从大型未标记语料库生成伪标签,创建半监督数据集。这……
Scaling Laws for Mixture Pretraining Under Data Constraints
随着语言模型的扩展,它们所需的数据量也在增长,但许多目标数据源(例如低资源语言或专业领域)本质上在大小上受到限制。一种常见的策略是将这种稀缺但有价值的目标数据与丰富的通用数据混合在一起,这提出了一个基本的权衡:混合物中的目标数据太少会使模型在目标域中暴露不足,而太多的目标数据会过度重复相同的示例,从而产生收益递减并最终导致过度拟合。我们在 2,000 多次语言模型训练中研究了这种权衡……
Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions
跨语言知识迁移对于为训练数据不足的语言构建高性能的多语言语言模型至关重要。当目标语言数据稀缺时,涉及科学推理、常识推理和世界知识等许多下游任务所需的知识必须主要从高资源语言获取,因此有效的知识迁移至关重要。改进这种跨语言知识转移的现有方法需要大量并行数据、翻译系统、辅助模型或额外的训练阶段……
The P-Completeness of Inverted Index Traversal: On the Complexity of Evaluating Boolean Query DAGs
现代人工智能代理越来越依赖搜索基础设施来执行复杂的神经符号推理工作流程。这些工作流程通常编译成对文本字段的深度嵌套、非单调布尔查询。然而,在处理这些结构时,倒排索引的标准查询评估策略面临着严格的理论限制。有状态迭代器模型(一次文档)在结构上受到 NC^1 公式评估的限制,在展开重新收敛逻辑时,查询复杂性会遭受最坏情况的 O(2^|Q|) 指数爆炸。相反,递归物化模型......
大型语言模型 (LLM) 表现出广泛的类人行为,从表达思想和情感,到与用户建立关系,再到拒绝请求和维护边界。尽管法学硕士很普遍,但研究人员和从业者缺乏方法和经验见解来就法学硕士应该表现出何时以及何种类型的类人行为做出明智的决定。为了填补这一空白,我们使用法学硕士作为法官和人类评估,对这些行为的普遍性、潜在影响和可控性进行了多维分析。超过 21,000 个……
GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
带可验证奖励的强化学习 (RLVR) 通常通过组相对策略优化 (GRPO) 进行优化,已成为提高预训练语言模型推理能力的核心方法,但目前的研究仍然主要以英语为中心。我们对多语言和非英语 GRPO 进行了大规模的实证研究,涉及广泛的基础模型、训练语言和不同的推理语言奖励。我们发现,母语推理训练通常与英语推理训练差距很小。我们进一步观察到强...
MVICAD2: Multi-View Independent Component Analysis with Delays and Dilations
多视图设置中的机器学习技术面临着重大挑战,特别是在集成异构数据、对齐特征空间和管理特定于视图的偏差时。这些问题在神经科学中很突出,通过分析来自相同刺激的多个受试者的数据来揭示大脑活动动态。在脑磁图 (MEG) 中,信号是在头皮水平捕获的,估计大脑的潜在来源至关重要,尤其是在假设所有受试者的来源相似的群体研究中。常用的方法,比如Multi-View...
A Specialized Semismooth Newton Method for Kernel-Based Optimal Transport
基于内核的最优传输 (OT) 估计器提供了一种替代的功能估计程序来解决样本中的 OT 问题。最近的研究表明,在比较高维概率度量时,这些估计器比插件(基于线性编程)OT 估计器在统计上更有效[Vacher et al., 2021]。不幸的是,这种统计优势是以非常高昂的计算代价为代价的:因为它们的计算依赖于短步内点法(SSIPM),而这种方法在实践中会带来大量的迭代次数,所以这些估计器很快就会变得……
When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs
随着对机器学习中数据隐私的担忧不断增加,从训练模型中遗忘或删除特定数据点的能力变得越来越重要。尽管最先进的遗忘方法已经出现,但它们通常平等地对待遗忘集中的所有点。在这项工作中,我们通过询问是否需要删除对模型学习影响可忽略不计的点来挑战这种方法。 Through a comparative analysis of influence functions across language and vision tasks, we identify subsets of training data with negligible impact on model outputs…