通过深度低阶残差蒸馏锁定预训练权重

近年来,开放权重语言模型的质量有了显着提高。共享权重可以在不同的硬件和软件平台上使用,从而极大地促进了模型的采用。它们还允许更开放的研究和测试,用户可以将它们用作检查点,根据自己的需求对其进行微调,并可能重新分发它们。然而,在某些情况下,对修改这些权重以防止未经授权的使用的担忧可能超过给予用户这种自由的好处。防御这种适应并非易事:因为适应性......

来源:Apple机器学习研究

近年来,开放权重语言模型的质量有了显着提高。共享权重可以在不同的硬件和软件平台上使用,从而极大地促进了模型的采用。它们还允许更开放的研究和测试,用户可以将它们用作检查点,根据自己的需求对其进行微调,并可能重新分发它们。然而,在某些情况下,对修改这些权重以防止未经授权的使用的担忧可能超过给予用户这种自由的好处。防御这种自适应并非易事:由于自适应攻击者可以根据定义观察所有权重和架构,因此他们可以逆转简单的结构防御,并使用优化来击败最简单的锁定机制。在这项工作中,我们利用自动微分的推理训练不对称性作为新的防御轴。我们提出了 DLR-Lock 方法,模型的提供者故意用具有可比参数数量的深度低秩残差网络 (DLR-Net) 替换模型中的每个预训练 MLP,强制激活内存在反向传播期间随深度线性增长。 DLR-Nets 通过模块式蒸馏进行有效训练。我们表明,除了内存开销之外,DLR-Lock 还会导致架构不匹配,从而使标准微调的优化环境变得复杂,并且向后传递会比向前传递产生更多的开销。我们的防御成功地抵御了充分了解防御策略的自适应攻击者,同时保留了原始模型的功能。 LLM 的实验验证了这些说法。

  • † 东京大学
  • ** 在 Apple 期间完成的工作