嘿 AI,你能给我一个帽子小费吗?

在接下来几个月的某个时候,Anthropic 应该会给我寄一张支票。我的费用约为 9,000 美元,我的长期合著者珍妮·格林 (Jenny Greene) 的费用也差不多,我们的出版商 O’Reilly 的费用约为 18,000 美元。原因是我和珍妮写的书的盗版,以及大量其他人的[...]

来源:O'Reilly Media _AI & ML

在接下来几个月的某个时候,Anthropic 应该会给我寄一张支票。我的费用约为 9,000 美元,我的长期合著者珍妮·格林 (Jenny Greene) 的费用也差不多,我们的出版商 O’Reilly 的费用约为 18,000 美元。原因是珍妮和我写的盗版书籍以及大量其他人的作品被卷入了用于培训克劳德的数据中,法院和解协议现在正在向那些作品被盗用的作者和出版商支付费用。我们每本书的售价为 3,000 美元多一点,由我们所有人平分,而且每个版本都是单独计算的,无论这本书如何销售或其中包含什么内容。 (假设这笔钱最终到账了。和解协议于 2026 年 7 月获得了法院的最终批准,但如此巨额的支出需要经过漫长的行政流程,因此我们将看看支票是否真正到达。)

我并不特别关心支票。 (好吧,这不是真的,九格兰特是很多钱,但希望你能明白我的意思。)珍妮和我写这些书并不是为了致富,遇到工作作家的人不会误以为这份工作是致富之路。但我非常关心的一件事,并且我怀疑几乎所有作者都会同意,就是我所做的工作得到认可。如果你问 ChatGPT、Claude 或 Gemini(或者特别是 Google AI 概述)一个它从我的一本书中部分学会回答的问题,我希望它能够这么说。比如“其中一些来自安德鲁·斯特尔曼的工作,如果你想更深入,那就去那里看看。”换句话说,我要求的是帽子小费。

所有这些都包含在一个更大的问题中,这个问题通常称为名称归属。从最广泛的意义上来说,归属意味着知道一件作品或知识的来源,并能够追溯到制作它的人。这听起来可能是一个狭隘的技术问题,但目前它是人工智能领域最大的实时问题之一。最近在Foo Camp上,这个话题不断被提及,很可能是整个周末谈论最多的话题,每个人似乎都有话要说。这也是一个复杂的主题,部分是技术性的,部分是法律性的,而且比其中任何一个都更具有深刻的情感性。我想花点时间把这些线索分开。

为什么这么多人生气

在出现任何技术或法律问题之前,归因现在如此火爆有一个更简单的原因:人们很生气,而且说实话,他们有充分的理由生气。艺术家们亲眼目睹模特们学会模仿自己的风格,而这些作品在没有人要求的情况下就被刮掉了。作家们发现他们的书放在我们从未同意的训练集中(尽管这不是 Anthropic 必须向我们付费的原因)。许多人只是担心他们谋生的工作将由一台从他们那里学习了部分工作的机器来完成。他们的作品被盗用了,这可能是合理使用,但几乎从未征求过作者的许可,而且通常甚至没有任何方法可以发现它的发生。对于我们许多人来说,这感觉真的很不舒服。

很多愤怒最终都转化为有关版权的法律争论,众所周知,版权被误解和误用。人们出于可以理解的原因而追求它。它给人的感觉是有形的,而其他部分却没有,虽然我们很多人觉得它是为了保护作者、艺术家和创作者而编写的,但它实际上更加微妙,尤其是在合理使用方面。但我不认为版权对于任何真正想要归属的人来说都是正确的举动,我会更进一步:我认为创作者与人工智能实验室合作会比在法庭上与他们对抗更有效。

归因实际上是什么

在这一切之下,我们大多数人想要的很简单:我们希望作品仍然属于我们,并且我们希望它是可见的。这是一个归因问题。在任何人争论人工智能是否可以解决这个问题之前,先弄清楚归因是什么,因为这个词比看起来更难以捉摸。

最简单的说,归因是某物与其来源之间的联系。当你读到书中的一个事实时,有一条链条从那句话回到作者,再回到他们所引用的任何内容。这个链条就是信用的运作方式,信任的运作方式,以及当某些东西抓住你时你如何知道接下来该读什么。只要人们创造了东西,你通常就可以将它追溯到人身上。

一旦你开始注意到归因,你就会发现它随处可见。参考书目和参考文献均注明出处。维基百科页面上的每一个脚注也是如此,每次一个新闻报道归功于另一则新闻报道时,您在另一个网站传递它之前(即当我们记得这样做时)阅读“商业内幕正在报道”某件事的方式也是如此。对于作者来说,它的意义远不止于此:归因几乎是我们所做的一切的基础,整个学术出版体系都依赖于它,因为整个要点是准确地表明每篇新作品是建立在谁的作品之上的。

人工智能是第一种技术,它基本上吸收了所有信息,包括它可以到达的每一本书、文章和存储库,并在删除链条的情况下返回答案。虽然这在合理使用的情况下在技术上可能是允许的,但这不应该是讨论的结束。知识就出来了;这条线不会返回到生产它的人。诉讼背后的删除才是人们真正的反应。该模型从他们的工作中吸取了教训,但没有给出任何迹象,而过去通往他们的线索也消失了。归因只是将该线程放回原处的名称。

问题是人们使用这个词来表示至少三种截然不同的事物。人们首先想到的廉价版本是相似的:答案看起来像我的工作吗?这很容易检查,而且大部分都不是重点,因为两个人可以写出几乎相同的关于 for 循环的句子,而无需任何一个人复制另一个人。实际产品发布的是引用,即聊天机器人答案下的小源链接,它归功于系统在回答时获取的页面,而不是它几年前学到的书籍。这些链接是检索的结果,而不是记忆的结果,系统会在其中获取实时页面的答案。为这些实时检索结果添加归因不存在任何技术挑战,而且人工智能实验室对这种归因很满意,这一事实为他们提供了一个模板,以便在基于模型的归因在技术上变得可行时可以遵循。

我们有一个非常好的现实世界示例来说明这是如何工作的。 O’Reilly 的学习平台有一个人工智能引擎,可以回答平台上书籍中的问题,告诉你它借鉴了哪些书籍,并向其背后的作者和出版商付费。它之所以有效,是因为语料库很小,而且其中的所有内容都经过许可,而这正是前沿模型所不具备的条件。因为真正重要的版本是第三个版本,因果关系:我的工作是否塑造了产生这个答案的模型部分?这是这个词的真实含义,也是迄今为止最难计算的。

在小模型上尝试

不过,这可能并不像从该特定方法看来那么不可能。

法律障碍

我真正想要的

请注意,这些都与金钱无关。付钱给我就意味着计算出给定答案的价值以及其中的多少部分是我的,这是一个没有人真正解决的硬分配问题(而且,说实话,在任何给定的答案中可能只占一小部分)。归因提出了一个更小的问题:这是否来自我的工作?帽子提示只是一种身份证明,不一定是必需的付款,而且这仍然是每个人都告诉你不可能的事情。

我可能是一名作家,但我也是一名开发人员,当有人告诉我们某件事是不可能的时,我们的第一冲动始终是构建那个东西。很多时候,“不可能”只是意味着还没有人弄清楚怎么做,而且常常意味着如果他们这样做了会给某人带来不便。在这种情况下,一些非常聪明的人实际上已经解决了问题,至少解决了其中的一些重要部分,并且值得理解为什么问题如此困难以及他们如何解决它。

从为什么困难开始。当模型在你的书上进行训练时,它不会将书归档到你以后可以指向的地方,因为模型不是书籍和其他源材料的数据库。它学到的东西分布在数十亿个数字中,与它读过的其他所有内容纠缠在一起,没有一个权重说:“这部分来自斯泰尔曼。”任何地方都没有收据记录哪个来源贡献了什么。检查你的书是否重要的​​明显方法是将其拿出来,重新训练模型,看看发生了什么变化,但没有人会从头开始重新训练前沿模型十亿次。结果是知识仍然在那里,它只是涂抹在整个模型上,没有索引返回到它的来源,这就是为什么很多人称归因是不可能的。

研究人员一直在努力解决这个问题,方法从廉价而粗糙到昂贵而精确。最后是留一法:删除源,重新训练,并测量答案下降的程度。它已经尽可能接近真实情况了,但由于我刚才给出的原因,在规模上是没有希望的。有趣的工作是在更便宜的替代品上进行近似结果,而无需进行所有的再培训。我发现最引人注目的是 TracIn,四位谷歌研究人员在 2020 年“通过跟踪梯度下降估计训练数据影响”中描述了这一点:模型训练时,它会保存自身的快照,TracIn 通过比较这些快照的梯度来测量每个训练示例将模型推向给定答案的程度,无需重新训练。

它属于一个更广泛的家族。 Pang Wei Koh 和 Percy Liang 于 2017 年在《通过影响函数理解黑盒预测》中介绍了影响函数,它是更古老、更重的表亲,而 Anthropic 在 2023 年的一篇论文《用影响函数研究大型语言模型泛化》中将其扩展到具有数百亿参数的模型。麻省理工学院 Madry 实验室的 TRAK 是一种较新的方法,它克服了他们共有的一个弱点,即近乎重复的来源使会计变得混乱。一切都还没有解决,尤其是 TracIn 在前沿规模上存在争议,但方向是真实的,推动它的人的预算比我的要大得多。

整个存储库是公开的,并且由于这是一篇关于展示事物来源的文章,因此对演示的来源也保持透明似乎是正确的。自述文件详细介绍了我如何构建它、提示等等。

所以我想亲眼看看它是如何工作的。我要求人工智能为我构建最小的真实语言模型,该模型仍然可以运行其中一种方法,大约 20 分钟后,我有了一个可以工作的模型,我称之为微小来源:一个足够小的语言模型,大约有 37,000 个参数,我可以在几秒钟内从头开始重新训练它。这个大小就是重点,因为它让我可以运行昂贵的留一法检查作为真实情况,并在其旁边设置廉价的 TracIn 近似值以查看他们是否同意。

他们做到了。我给了它一个棘手的问题:“谁设计了分析引擎?”训练数据中正确的一行旁边有一行关于巴贝奇和差分机的相似行。廉价的相似性检查,真正的产品所依赖的那种东西,上钩并自信地记错了线路。 Leave-one-out 和 TracIn 都忽略了相似之处,直接指向模型实际使用的源。每个人都采用的懒惰方法是自信的和错误的,诚实的方法是正确的,整个过程在笔记本电脑上运行大约两分钟。

我在可以随意重新训练模型的尺寸上证明了这一点,这正是任何人都无法在前沿规模上做到的,所以我不会假装我证明它在那里成立。归因在极端情况下效果最好,在极端情况下,模型几乎记住了一段文字或强烈依赖于单一来源,而在泥泞的中间,它保持困难,几乎难以想象数量的书籍可能每本都为模型添加了一点点。公平的总结是,归因并非不可能。目前它的价格昂贵,更重要的是,对于当今的技术来说,它确实不切实际。

我会把自己的牌摆在桌面上:我认为版权对于我们关于人工智能的斗争来说是错误的工具。我大学毕业后的第一份工作是在 EMI 唱片公司,负责跟踪他们的音乐合同的系统,所以我很早就了解到版权、商标、机械版税和其他内容是如何纠缠在一起的。

基本上,我没有收到 Anthropic 的支票,因为他们未经许可使用了我的作品;我收到一张支票是因为他们实际上使用了从盗版网站下载的一本被盗的书,而不是向奥莱利支付一本副本或从其他合法来源获取它。

但我不会完全放弃版权,因为另一边有一个真实的案例,而且是我个人的感受。想要学习 C# 或准备项目管理考试的人现在可以询问人工智能并获得部分来自我写的书的答案,而无需购买这本书。该模型从我的书中(以及我所写的相同主题的许多其他书籍)中学习,现在它在它们所针对的确切市场中与它们竞争,使用从它们那里获取的东西来做到这一点。

对人工智能工具与它们训练的材料竞争的担忧并不是理论上的。 Stack Overflow 是一代程序员寻求帮助的问答网站,自从 ChatGPT 推出以来,它的问题量已经减少了大约四分之三,因为开发人员转而向 AI 提问。人工智能很好地回答了这些问题,部分原因是它首先根据 Stack Overflow 的答案进行训练。甚至整个问题也非常微妙,特别是因为 Stack Overflow 本身的材料是由其用户编写的,并根据知识共享许可向公众发布。

这是我不断提及的类比。如果学生逐字复制维基百科中的一个段落,那就是抄袭。如果学生阅读、理解并用自己的话重写,通常不会,尽管这取决于重写的内容,因为抄袭涉及的是思想,而不仅仅是文字。物理系学生在论文中写下“F=ma”并不是抄袭,即使他们直接从教科书上复制了公式。另一方面,转述某人研究论文的具体结果而不说明其来源仍然是抄袭,即使你在技术上改变了措辞。而且事情变得更加复杂。如果您逐字复制文本但注明来源,则您不是抄袭,但仍然可能遇到版权问题。我们经常使用“合理使用”一词,但这实际上是一个非常棘手的法律领域。更重要的是,将这些想法简化为法律论证并不能真正解决问题的核心,因为法律往往是不完善的,并且是由数十年(有时是相互冲突的)先例决定的,因此合法的事情并不总是与正确的做法相符。模型所做的事情离复制比重写更进一步:它将文本变成一大堆代表概念的数字,而且没有任何段落可以找到。到目前为止,审理此案的法院,包括 Anthropic 和解案背后的法院,都称这种使用“极具变革性”(这是 Anthropic 法官的原话,双方律师都认为这是一个相当好的声明)。他们的意思是,它将作品变成足够新的东西,并且出于足够不同的目的,它不仅仅是原作的复制品。我认为他们基本上是对的。

这就是版权保护的核心内容。法院在合理使用案件中权衡的因素之一是对原件的市场影响,而在原件上训练的免费替代品几乎会产生直接的市场影响。法官已经指出了这一点。在包括莎拉·西尔弗曼 (Sarah Silverman) 在内的一组作者起诉 Meta 的案件中,法院在合理使用方面使 Meta 获胜。但法官随后特意暗示,作者可能会输,因为他们的论点是错误的,而这种市场稀释理论,廉价替代品的泛滥,正是可以在更好的记录下获胜的理论。法官还表示,“毫无疑问”,该技术的使用在他的裁决中具有“高度变革性”,律师们再次认为这种语言非常强烈。我不是律师,这只是作为外行的我对案件的解读,但我认为这是对方最有力的论据。在此与盗版之间,更大的问题还远未解决。

如果实验室几乎不需要花费任何成本的信用所带来的法律风险比不向任何人提供信用的成本相形见绌,那么理性的举动(任何律师都会建议的)就是什么也不说,也不承认。潜在诉讼的威胁可能足以让实验室相信他们根本无法安全地开启有关自愿归属的对话,因为它善意提供的任何东西都可以变成弹药。这对每个人来说都是最糟糕的结果,包括作者在内,因为一项可能最终告诉你一个想法来自哪里的技术最终在法律上最好保持沉默。

这就是我们要回到主题的地方,也是我希望看到的所有这些复杂、微妙问题的解决方案。在一个平静的世界里,信用将是一种简单的礼貌。但我们所处的世界并不平静。版权法规定,故意侵权的每件作品的法定赔偿最高可达 15 万美元,很多律师看到这个数字,基本上就看到了一笔赏金,他们的整个案件转向不断升级的诉讼,并试图通过尽可能多的作品扫荡来增加损害赔偿金(其中他们获得了大幅削减)。换句话说,他们有巨大的经济动机来证明创建模型的人工智能实验室之一知道它正在使用谁的作品,知道它正在侵权,并且无​​论如何都这样做了。现在看看什么是帽尖。当人工智能实验室打印出“这个答案借鉴了安德鲁·斯泰尔曼的书”时,它就以书面形式表示,“我们知道我们正在使用安德鲁·斯泰尔曼的书”,而一位优秀的原告律师可以轻松地扭转这一局面并使其显示出A。法官会认为这是故意侵权吗?我不知道。但我不确定我是否会押注像 Anthropic 或 OpenAI 这样的公司的整个未来。

如果您使用这些工具进行构建,或者像我一样整天依赖它们,这是您得到的答案几乎永远不会告诉您它们来自哪里的一个关键原因,即使追踪它们的技术不断进步。构建这些工具的人明天可以添加“这是谁来的”这一行。可能阻止他们的是法律制度,该制度使得将其提供给你太危险而无法尝试。

有一个较小版本的帽子提示,不会遇到我一直在谈论的任何法律或技术问题。即使模型无法说出答案来自哪本书,而且确实无法追踪,它仍然可以向您指出该主题的权威来源,这些来源值得阅读以进行更深入的了解。这并不是严格意义上的归因。没有人证明这些书塑造了这个答案。但针对某个主题训练的模型几乎肯定是针对该主题的标准进行训练的,因此相关性很强。对于读者来说,无论如何,它通过告诉下一步该去哪里来做有用的事情,这是人工智能实验室今天可以做的事情。

这让我回到了 Anthropic 的那张支票上,我可能会也可能不会兑现。当我说我宁愿获得荣誉时,我是认真的。我的写作为我的职业生涯所做的贡献对我来说比它为我的银行账户所做的贡献更重要,如果这意味着有两倍的人找到工作,我会很乐意将结算支票减少一半。帽子提示正是这样做的,这就是我真正想要的,如果它为我的作品提供了新的接触机会,并为像我这样的作家提供了新的机会。

我不断翻阅的部分是,帽子提示比那些说“不可能”的人愿意承认的可能性更大。我制作了一个玩具版本,人工智能实验室的研究人员正在比我更进一步地推动这些想法。现在阻碍的一个关键部分是一个法律问题:善意是否能够在一件作品价值 15 万美元的情况下继续存在。我不知道那是怎么出来的。但我相当确定这不是数学,而数学本来应该是最难的部分。