地令关键词检索结果

通过校准的稀疏注意力加速文本到视频的生成

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

最近的扩散模型可以生成高质量的视频,但运行时间很慢。这些模型中使用的基于变压器的大型骨干网受到时空注意力的瓶颈。在本文中,我们发现很大一部分令牌到令牌连接在各种输入中始终产生可以忽略不计的分数,并且它们的模式经常在查询中重复。因此,在这些情况下,注意力计算可以被跳过,对结果几乎没有影响。对于本地令牌块之间的连接,这一观察结果仍然成立。受此激励,我们...