详细内容或原文请订阅后点击阅览
数据约束下混合预训练的缩放定律
随着语言模型的扩展,它们所需的数据量也在增长,但许多目标数据源(例如低资源语言或专业领域)本质上在大小上受到限制。一种常见的策略是将这种稀缺但有价值的目标数据与丰富的通用数据混合在一起,这提出了一个基本的权衡:混合物中的目标数据太少会使模型在目标域中暴露不足,而太多的目标数据会过度重复相同的示例,从而产生收益递减并最终导致过度拟合。我们在 2,000 多次语言模型训练中研究了这种权衡……
来源:Apple机器学习研究随着语言模型的扩展,它们所需的数据量也在增长,但许多目标数据源(例如低资源语言或专业领域)本质上在大小上受到限制。一种常见的策略是将这种稀缺但有价值的目标数据与丰富的通用数据混合在一起,这提出了一个基本的权衡:混合物中的目标数据太少会使模型在目标域中暴露不足,而太多的目标数据会过度重复相同的示例,从而产生收益递减并最终导致过度拟合。我们研究了超过 2,000 次语言模型训练运行的这种权衡,这些训练运行涵盖多个模型和目标数据集大小以及多种数据类型,包括多语言、特定领域和质量过滤的混合数据。在所有设置中,我们发现重复是目标域性能的核心驱动因素,并且混合训练比单源训练容忍更高的重复:稀缺目标语料库可以重复使用 15-20 次,最佳重复次数取决于目标数据大小、计算预算和模型规模。接下来,我们引入一种重复感知的混合缩放定律,该定律解释了重复目标标记的价值递减和通用数据的正则化作用。优化缩放定律提供了计算有效混合配置的原则性方法,从而为数据约束下的预训练提供实用的混合建议。
