详细内容或原文请订阅后点击阅览
通过校准的稀疏注意力加速文本到视频的生成
最近的扩散模型可以生成高质量的视频,但运行时间很慢。这些模型中使用的基于变压器的大型骨干网受到时空注意力的瓶颈。在本文中,我们发现很大一部分令牌到令牌连接在各种输入中始终产生可以忽略不计的分数,并且它们的模式经常在查询中重复。因此,在这些情况下,注意力计算可以被跳过,对结果几乎没有影响。对于本地令牌块之间的连接,这一观察结果仍然成立。受此激励,我们...
来源:Apple机器学习研究最近的扩散模型可以生成高质量的视频,但运行时间很慢。这些模型中使用的基于变压器的大型骨干网受到时空注意力的瓶颈。在本文中,我们发现很大一部分令牌到令牌连接在各种输入中始终产生可以忽略不计的分数,并且它们的模式经常在查询中重复。因此,在这些情况下,注意力计算可以被跳过,对结果几乎没有影响。对于本地令牌块之间的连接,这一观察结果仍然成立。受此启发,我们引入了 CalibAtt,这是一种无需训练的方法,可通过校准的稀疏注意力加速视频生成。 CalibAtt 执行离线校准过程,识别跨输入稳定的块级稀疏性和重复模式,并将这些模式编译为每个层、头部和扩散时间步长的优化注意操作。在推理时,我们密集地计算选定的依赖于输入的连接,并以硬件高效的方式跳过未选定的连接。在 Wan 2.1 14B、Mochi 1 和各种分辨率下的几步蒸馏模型上进行的大量实验表明,CalibAtt 实现了高达 1.58 倍的端到端加速,优于现有的免训练方法,同时保持视频生成质量和文本视频对齐。
