诺亚·戈洛维奇访谈——游戏和动态环境中学习的理论基础

“数据中的潜意识效应:通过对数线性的一般机制。”图片来源:Ishaq Aden-Ali、Noah Golowich、Allen Liu、Abhishek Shetty、Ankur Moitra 和 Nika Haghtalab。在 ACM SIGAI 出版物《AI Matters》的这篇交叉文章中,Ella Scallan 采访了 2025 年 AAAI 博士论文奖获得者 Noah Golowich。诺亚讨论他的 [...]

来源:ΑΙhub

“数据中的潜意识效应:通过对数线性的一般机制。”图片来源:Ishaq Aden-Ali、Noah Golowich、Allen Liu、Abhishek Shetty、Ankur Moitra 和 Nika Haghtalab。

在 ACM SIGAI 出版物《AI Matters》的这篇交叉文章中,Ella Scallan 采访了 2025 年 AAAI 博士论文奖获得者 Noah Golowich。诺亚讨论了他对多智能体强化学习的研究、复杂动态环境中学习的计算挑战,以及理论见解可以告诉我们当今人工智能系统能力日益增强(有时甚至不可预测)的行为。

您荣获2025年AAAI博士论文奖。您的论文研究主题是什么?为什么这是您感兴趣的研究领域?

我的论文重点关注两个密切相关的问题设置的理论基础,即游戏中的决策和学习。在较高的层面上,论文提出了这样的问题:智能体如何才能最好地做出决策来应对不断变化的环境以及与他人的互动?这些都是非常基本的问题——机器学习和人工智能各个领域研究的各种任务,从“机器人应该如何在其环境中导航?到“算法应该如何在竞争激烈的市场中发挥作用?”涉及这样的过程。我的论文从理论角度解决这些问题,考虑可以捕获此类决策问题的显着方面的数学模型,然后严格证明在给定某些限制(例如有限的计算)的情况下,代理可以做什么和不能做什么。

推动我进入这一领域的一个因素是,我研究的许多问题都具有数学上优雅且基本的公式,但对于当前几代机器学习算法所面临的一些更实证的问题来说,它们也是合理的模型。我发现能够解决相对简单的问题(在某些情况下已经开放很长时间),但也与人工智能的最新发展相关,例如对强化学习的兴趣增加,这真的很令人兴奋。

您的论文的主要贡献或发现是什么?

本论文在三个主要领域做出了贡献。论文的第一部分重点关注一个被称为“游戏中学习”的领域,它粗略地描述了多个自利主体在一系列回合中反复相互交互的环境,每个主体都旨在优化自己的个人效用。为了说明这一点,一个典型的例子是每个人每天都必须选择一条驾驶路线,目的是在道路可能出现拥堵的情况下最大限度地减少通勤时间。这里的一个关键问题是:随着时间的推移,代理人的策略如何演变?我们能否证明它们在某种意义上收敛到均衡?我论文的主要结果之一在很大程度上解决了这个问题:当智能体根据称为“无悔学习算法”的特定算法系列做出选择时,我们建立了第一个接近最优的收敛速度。

近年来您的研究领域有何发展?

同时,解决该领域一些更基本的理论问题仍然具有重要价值。生成式人工智能当然提供了巨大的机遇,但它也带来了许多风险。为了帮助我们应对此类风险,对现有算法的工作原理有更原则的理解是有帮助的。事实上,理论可以成为一个非常有用的工具,帮助我们沿着这些思路提出正确的问题。

关于诺亚

然后,我的论文继续考虑决策问题的一个相关方面,即我们做出的决策往往会影响未来环境的状态。例如,想象一个机器人在一个房间里导航:如果它不小心推倒了一个物体,那么房间的平面图就会改变。因此,除了捕获多智能体交互之外,我们的模型还应该反映学习通常在动态环境中进行。此类环境通常使用强化学习 (RL) 框架进行建模。通常强化学习的目标是学习一个好的策略,它告诉我们要采取什么行动来应对当前的环境状态。举一个简单的例子,如果机器人检测到正前方有墙,它的策略可能会告诉它转身。

最近出现了大量的理论工作,调查研究需要与环境进行多少互动才能学习良好的政策。然而,这些工作中的许多工作没有考虑学习好的策略所需的计算量:鉴于现实环境可能有大量可能的配置,这通常是一个关键瓶颈,并且通常找到一个好的策略需要有效地探索这些可能的配置。我的论文解决了在描述环境如何响应我们的行为而演变的许多建模假设下,通过计算有效地学习良好策略的问题。为此,它为存在潜在大型和复杂环境的探索的核心和基本问题开发了新的原语。

我论文的最后一部分本质上结合了前两部分的各个方面:它考虑如何在动态且涉及多个交互代理的环境中学习良好的策略。这些问题属于多智能体强化学习 (MARL) 的范畴,多年来,该技术已得到广泛应用,从自动驾驶到玩诸如《外交》或《星际争霸》等高难度游戏。我关于这个主题的论文的主要收获之一是,我之前描述的在游戏中学习的几个任务实际上在这种 MARL 设置中变得棘手。特别是,在可信的计算假设下,我们表明对于某些此类问题没有有效的算法。因此,在多智能体强化学习中,我们需要更仔细地考虑问题中的附加结构:例如,我的论文进一步表明,在对博弈或均衡类型进行适当假设的情况下,可以规避这种棘手问题。

在过去几年中,机器学习和人工智能研究领域发生了迅速变化,人工智能在编写代码、解决具有挑战性的数学问题等方面具有令人印象深刻的能力。这种转变导致许多研究人员重新思考他们要问什么问题的优先事项。例如,强化学习最近因其在微调法学硕士方面的实用性而受到广泛关注,因此人们越来越多地致力于对强化学习微调算法修改语言模型能力的特定方式进行建模。

您现在关注的重点是什么,哪些未来方向或开放性问题最让您兴奋?

您一直立志成为一名研究员吗?

您对您所在领域的早期职业研究人员有什么建议吗?

艾拉·斯卡兰是 AIhub 的助理编辑

如今,我研究的一个主要方向集中在本质上更具经验性的问题,旨在为法学硕士提出更好的数学模型并通过实验验证它们。最近的许多研究都显示了法学硕士的令人惊讶或不良的行为,例如绕过其安全培训的方法,或者在某些数据集上进行培训可能会导致模型出现意外行为的情况。更好地理解为什么会出现此类行为并减轻一些相关风险是我工作背后的关键激励因素。

一个主要的开放研究方向是为语言模型(以及其他模态的生成人工智能模型,例如图像)提出简单的通用抽象,这些抽象具有理论基础,但也可以预测在大规模模型中观察到的经验现象。我的一项工作提出了这样一种抽象,基于与法学硕士相关的某个矩阵中的低秩结构。作为这种抽象应用的一个例子,我们在经验和理论上都表明,这种结构可以解释语言模型中令人惊讶的“潜意识学习”现象,即在某些数据集上训练它们可以导致出现的属性,而这些属性仅通过查看数据集并不能立即显现出来。

最后,我仍然对我的论文研究的有关平衡计算的一些更基本的问题感兴趣。当涉及到玩家策略数量相对较少的游戏时,我们对均衡计算的理解相当完整。然而,与现代人工智能环境相关的游戏类型,例如我上面讨论的多智能体强化学习问题,具有智能体拥有大量策略的特性。事实上,策略通常对应于代理的所有可能的决策策略,这些策略告诉他们在环境的每种可能的状态或配置下要做什么。例如,为了说明这一点,诸如国际象棋之类的游戏中的策略将对应于知道在给定游戏板的任何状态下要移动哪个棋子。对于许多类型的此类游戏,用于计算均衡的最著名的可证明算法与已知的棘手结果的可能算法之间仍然存在很大差距。我的工作旨在缩小其中一些差距。

在本科期间,我探索了多种可能性,包括暑期和学期研究机会以及公司实习机会。我发现做研究最让我兴奋,因为研究固有的许多开放式问题需要创造力。作为一名本科生和研究生,我真的很幸运,拥有令人难以置信的顾问和合作者,与他们一起做研究非常有趣。

我鼓励早期职业研究人员致力于真正令他们兴奋的主题。做研究需要反复的挫折,需要很大的毅力。如果你正在做自己真正热爱的事情,并且喜欢整个过程,包括其中更棘手的部分,那么投入所需的时间和精力进行良好的研究会比仅仅获得最终结果要容易得多。

另一条建议涉及机器学习和人工智能新发展的加快步伐。虽然研究领域总是在变化,但今天的进步感觉要快得多,这在很大程度上要归功于法学硕士和更广泛的生成人工智能的进步。有时,随着该领域不断向前发展,可能会感觉很难站稳脚跟并找到需要关注的正确问题。虽然了解最新进展很重要,但能够区分一个领域中最基本的问题和挑战也同样重要——在不断取得进展的情况下,这些问题和挑战最有可能继续作为主要研究目标。