通过词汇干预在数据约束下进行多语言知识转移

跨语言知识迁移对于为训练数据不足的语言构建高性能的多语言语言模型至关重要。当目标语言数据稀缺时,涉及科学推理、常识推理和世界知识等许多下游任务所需的知识必须主要从高资源语言获取,因此有效的知识迁移至关重要。改进这种跨语言知识转移的现有方法需要大量并行数据、翻译系统、辅助模型或额外的训练阶段……

来源:Apple机器学习研究

跨语言知识迁移对于为训练数据不足的语言构建高性能的多语言语言模型至关重要。当目标语言数据稀缺时,涉及科学推理、常识推理和世界知识等许多下游任务所需的知识必须主要从高资源语言获取,因此有效的知识迁移至关重要。改进这种跨语言知识转移的现有方法需要大量并行数据、翻译系统、辅助模型或额外的训练阶段,而这些对于许多语言来说基本上是不可用的。我们提出了 LINK——一种数据级干预方法,通过使用双语词汇对预训练数据的高资源部分进行词汇替换来改善模型预训练期间的知识迁移。对于给定的替换率,在高资源(英语)训练语料库的一部分中随机选择的单词与其单词级翻译进行交换,不需要额外的模型训练,只需要双语词汇,几乎任何语言都可以以接近零的成本获得双语词汇。对五种模型大小的八种语言的评估显示,目标语言的下游任务有显着改进,训练速度提高了 2 倍,以达到同等性能。