Segmental Attention Decoding with Long Form Acoustic Encodings
我们解决了基于注意力的编码器-解码器(AED)模型与长形式声学编码的根本不兼容问题。在分段话语上训练的 AED 模型通过利用片段边界之外的有限声学上下文来学习对绝对帧位置进行编码,但在解码这些线索消失的长片段时无法泛化。由于交叉注意力中键和值的排列不变性,该模型失去了对声学编码进行排序的能力。我们提出了四种修改:(1)将显式绝对位置编码注入每个解码的交叉注意力中......