IDEA Prune:生成式语言模型预训练中的一体化放大与剪枝流程

大型语言模型的最新进展加剧了在有限推理预算内对高效可部署模型的需求。与从头开始训练目标规模模型相比,结构化剪枝管道在令牌效率方面显示出潜力。

来源:Apple机器学习研究

大型语言模型的最新进展加剧了对在有限推理预算内高效可部署模型的需求。与从头开始训练目标规模模型相比,结构化剪枝流程在令牌效率方面显示出前景。在本文中,我们主张将先前工作中常被忽视的扩大模型预训练纳入剪枝。我们研究了作为一个集成系统的扩大-剪枝流程,以解决两个关键问题:即使模型从未部署,预训练扩大模型是否值得,以及如何优化整个流程以获得更好的剪枝模型。我们提出了一个集成的扩大-剪枝流程,它将扩大模型训练、剪枝和恢复组合在单一余弦退火学习率调度下。该方法进一步得到一种新颖的迭代结构化剪枝方法的补充,用于逐步参数移除。所提出的方法有助于缓解朴素扩大-剪枝流程中由学习率上升引起的知识损失,并实现模型容量在幸存神经元间的有效重新分配,促进平滑压缩和增强性能。我们进行了在预训练中使用多达2万亿令牌将2.8B模型压缩至1.3B的综合实验。它表明集成方法不仅提供了对扩大模型预训练令牌效率的见解,而且实现了剪枝模型的优越性能。

  • † 佐治亚理工学院
  • ‡ 德克萨斯大学奥斯汀分校
  • ** 在苹果公司期间完成的工作