详细内容或原文请订阅后点击阅览
当人工智能艺术没有作者时:研究发现生成的图像通常无法追溯到训练数据
一种从模型中彻底删除训练示例的新方法表明,随着数据集的增长,模型学习内容与其生成内容之间的联系消失。
来源:MIT新闻 - 人工智能当人工智能图像生成器生成肖像时,谁的作品进入其中?这个问题是全球诉讼、许可交易和拟议法规的核心问题。艺术家想要信誉。公司希望清晰。政策制定者想要一种分配责任的方法。
麻省理工学院计算机科学与人工智能实验室 (CSAIL) 的一组研究人员的新工作表明,对于在大型数据集上训练的模型,这个问题通常可能没有答案。这并不是说寻找它的工具不充分。连接本身已经消失。
科学家们发现了一种他们称之为归因衰减的现象,即生成模型训练的数据越多,任何单个训练示例对任何特定输出的影响就越小。这感觉违反直觉,但他们发现,在足够大的尺度下,您通常可以从训练数据中删除任何单个图像,或者给定艺术家的每张图像,或者给定人的每张照片,并且生成的样本不会改变。
研究人员认为,如果删除某些东西不会改变任何事情,就不能说它对任何事情负责。
“如果你拿走一段数据并且模型的输出没有改变,那么该数据就不会影响输出,”前麻省理工学院 CSAIL 研究员和该工作的主要作者郑戴 SM ’21、博士 ’24 说。 “因此,将输出归因于该数据并没有多大意义。如果您对所有其他数据一次执行此操作,并发现其中任何一个数据的输出都没有改变,那么将输出归因于其中任何一个数据就没有多大意义。”
Dai 和 Gifford 的项目在今天发表在《自然通讯》上的一篇开放获取论文中进行了描述。
再训练问题
数字中的一个惊喜:训练数据越多,集成与单模型对应的性能就越好,这表明它们实际上可能更具数据效率。
探索反事实宇宙
