渐进式细化:中英语码转换 ASR 的迭代伪标签方法

语码转换 (CS),即同一话语中的不同语言,由于 CS 训练数据有限,给自动语音识别 (ASR) 带来了重大挑战。本文首次将迭代伪标记训练方法应用于 CS-ASR,证明了其在利用未标记数据来提高 CS-ASR 性能方面的有效性。该方法包括三个阶段:伪标签生成、两阶段双语模型训练和迭代改进。它首先从大型未标记语料库生成伪标签,创建半监督数据集。这……

来源:Apple机器学习研究

事实证明,自我训练有助于解决许多领域的数据稀缺问题,包括视觉、语音和语言。具体来说,自我训练或伪标记会标记无监督数据并将其添加到训练池中。在这项工作中,我们研究并使用伪标签来实现最近提出的新颖设置:语音的联合转录和翻译,但该设置由于缺乏足够的并行数据资源而受到困扰。我们……