Scaling Laws for Mixture Pretraining Under Data Constraints
随着语言模型的扩展,它们所需的数据量也在增长,但许多目标数据源(例如低资源语言或专业领域)本质上在大小上受到限制。一种常见的策略是将这种稀缺但有价值的目标数据与丰富的通用数据混合在一起,这提出了一个基本的权衡:混合物中的目标数据太少会使模型在目标域中暴露不足,而太多的目标数据会过度重复相同的示例,从而产生收益递减并最终导致过度拟合。我们在 2,000 多次语言模型训练中研究了这种权衡……
Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions
跨语言知识迁移对于为训练数据不足的语言构建高性能的多语言语言模型至关重要。当目标语言数据稀缺时,涉及科学推理、常识推理和世界知识等许多下游任务所需的知识必须主要从高资源语言获取,因此有效的知识迁移至关重要。改进这种跨语言知识转移的现有方法需要大量并行数据、翻译系统、辅助模型或额外的训练阶段……