详细内容或原文请订阅后点击阅览
当遗忘是免费的:利用低影响力点来降低计算成本
随着对机器学习中数据隐私的担忧不断增加,从训练模型中遗忘或删除特定数据点的能力变得越来越重要。尽管最先进的遗忘方法已经出现,但它们通常平等地对待遗忘集中的所有点。在这项工作中,我们通过询问是否需要删除对模型学习影响可忽略不计的点来挑战这种方法。 Through a comparative analysis of influence functions across language and vision tasks, we identify subsets of training data with negligible impact on model outputs…
来源:Apple机器学习研究随着对机器学习中数据隐私的担忧不断增加,从训练模型中遗忘或删除特定数据点的能力变得越来越重要。尽管最先进的遗忘方法已经出现,但它们通常平等地对待遗忘集中的所有点。在这项工作中,我们通过询问是否需要删除对模型学习影响可忽略不计的点来挑战这种方法。通过对语言和视觉任务的影响函数进行比较分析,我们确定了对模型输出影响可以忽略不计的训练数据子集。利用这种洞察力,我们提出了一种有效的忘却框架,该框架可以在忘却之前减小数据集的大小,从而在现实世界的经验示例中显着节省计算量(高达约 50%)。
