BAIR领域信息情报检索

BAIR博客为BAIR研究人员提供了一个面向普通读者的易于理解的媒介,用于交流研究成果、领域观点和各种更新。博文由BAIR的学生、博士后和教师撰写,旨在向专家和普通读者提供相关和及时的研究成果和结果讨论。

从模型到复合 AI 系统的转变

The Shift from Models to Compound AI Systems

2023 年,AI 凭借大型语言模型 (LLM) 吸引了所有人的注意力,只需提示即可指示该模型执行一般任务,例如翻译或编码。这自然导致人们强烈关注模型作为 AI 应用程序开发的主要要素,每个人都想知道新的 LLM 将带来哪些功能。然而,随着越来越多的开发人员开始使用 LLM 进行构建,我们相信这种关注点正在迅速改变:最先进的 AI 结果越来越多地由具有多个组件的复合系统获得,而不仅仅是单片模型。例如,Google 的 AlphaCode 2 通过精心设计的系统在编程中设置了最先进的结果,该系统使用 LLM 为任务生成多达 100 万种可能的解决方案,然后筛选该集合。同样,AlphaGeomet

捉鬼敢死队:检测大型语言模型代写的文本

Ghostbuster: Detecting Text Ghostwritten by Large Language Models

Ghostbuster 的结构,这是我们用于检测 AI 生成文本的全新先进方法。大型语言模型(如 ChatGPT)的写作能力令人印象深刻,甚至因此成为问题。学生已经开始使用这些模型来代写作业,导致一些学校禁止使用 ChatGPT。此外,这些模型还容易生成存在事实错误的文本,因此谨慎的读者在信任生成 AI 工具之前,可能希望了解这些工具是否曾被用于代写新闻文章或其他来源。教师和消费者可以做什么?现有的用于检测 AI 生成文本的工具有时在处理与训练数据不同的数据时表现不佳。此外,如果这些模型错误地将真实的人类写作归类为 AI 生成,则可能会危及那些真实作品受到质疑的学生。我们最近的论文介绍了 Gh

通过特征凸神经网络实现非对称认证稳健性

Asymmetric Certified Robustness via Feature-Convex Neural Networks

通过特征凸神经网络实现非对称认证稳健性 TLDR:我们提出了非对称认证稳健性问题,它只需要对一个类进行认证稳健性,并反映了现实世界的对抗场景。这种集中设置使我们能够引入特征凸分类器,该分类器可在毫秒级产生闭式和确定性的认证半径。图 1. 特征凸分类器及其对敏感类输入的认证的说明。该架构由 Lipschitz 连续特征图 $\varphi$ 和学习到的凸函数 $g$ 组成。由于 $g$ 是凸的,因此它在 $\varphi(x)$ 处的切平面全局欠近似,从而在特征空间中产生认证范数球。然后,$\varphi$ 的 Lipschitz 性会在原始输入空间中产生适当缩放的证书。尽管深度学习分类器被广泛

目标表示用于指导跟随

Goal Representations for Instruction Following

目标表示用于遵循指令机器人学习领域的一个长期目标是创建能够为人类执行任务的通才代理。自然语言有可能成为人类指定任意任务的易于使用的界面,但很难训练机器人遵循语言指令。语言条件行为克隆 (LCBC) 等方法训练策略以直接模仿以语言为条件的专家动作,但需要人类注释所有训练轨迹,并且在场景和行为中的泛化能力较差。同时,最近的目标条件方法在一般操作任务中表现更好,但无法为人类操作员提供轻松的任务指定。我们如何才能协调通过类似 LCBC 的方法指定任务的便利性与目标条件学习的性能改进?从概念上讲,遵循指令的机器人需要两种能力。它需要将语言指令扎根于物理环境中,然后能够执行一系列动作来完成预期任务。这些能

重新思考 PPO 在 RLHF 中的作用

Rethinking the Role of PPO in RLHF

重新思考 PPO 在 RLHF 中的作用TL;DR:在 RLHF 中,奖励学习阶段(以比较的形式使用人类偏好)与 RL 微调阶段(优化单一的非比较奖励)之间存在矛盾。如果我们以比较的方式执行 RL 会怎么样?图 1:此图说明了绝对反馈和相对反馈的强化学习之间的区别。通过合并新组件 - 成对策略梯度,我们可以统一奖励建模阶段和 RL 阶段,从而实现基于成对响应的直接更新。大型语言模型 (LLM) 为功能越来越强大的虚拟助手提供支持,例如 GPT-4、Claude-2、Bard 和 Bing Chat。这些系统可以响应复杂的用户查询、编写代码,甚至创作诗歌。这些令人惊叹的虚拟助手背后的技术是带人类

使用强化学习训练扩散模型

Training Diffusion Models with Reinforcement Learning

使用强化学习训练扩散模型replay扩散模型最近已成为生成复杂高维输出的事实标准。您可能知道它们能够制作令人惊叹的 AI 艺术和超逼真的合成图像,但它们也在药物设计和连续控制等其他应用中取得了成功。扩散模型背后的关键思想是将随机噪声迭代地转换为样本,例如图像或蛋白质结构。这通常被激发为最大似然估计问题,其中模型被训练以生成尽可能接近训练数据的样本。然而,扩散模型的大多数用例并不直接与匹配训练数据有关,而是与下游目标有关。我们不只是想要一张看起来像现有图像的图像,而是一张具有特定外观的图像;我们不只是想要一个物理上合理的药物分子,而是想要一个尽可能有效的药物分子。在这篇文章中,我们展示了如何使用

关于自我监督学习的逐步性质

On the Stepwise Nature of Self-Supervised Learning

图 1:自监督学习中的逐步行为。在训练常见的 SSL 算法时,我们发现损失以逐步方式下降(左上),而学习到的嵌入则以迭代方式增加维度(左下)。嵌入的直接可视化(右图;显示了前三个 PCA 方向)证实了嵌入最初会折叠到一个点,然后扩展到 1D 流形、2D 流形,并随着损失的步骤而扩展。人们普遍认为,深度学习的惊人成功部分归功于它能够发现和提取复杂数据的有用表示。自监督学习 (SSL) 已成为一种领先的框架,用于直接从未标记数据中学习图像的这些表示,类似于 LLM 直接从网络抓取的文本中学习语言的表示。然而,尽管 SSL 在 CLIP 和 MidJourney 等最先进的模型中发挥着关键作用,但诸