本研究探讨了使用机器学习来对语音的声学特征进行分类以检测学龄前儿童的听力损失的可行性。承认早期听力损失识别的批评发展影响以及与该年龄段的传统测试方法相关的挑战,我们提出了一种新颖的,可扩展的方法杠杆自动语音分析。使用有或没有听力损失的儿童的语音记录,我们使用WAV2VEC 2.0并比较功能集来捕获语音特征并比较LSTM,DNN和XGBoost分类器。我们的发现表明,这些模型可以准确区分听力损失的儿童的语音和正常听力的儿童的语音,最多可获得96.4%的精度。这项概念验证研究表明,使用语音进行早期听力损失检测的潜力,以及通往非侵入性,可扩展的筛查工具的途径,这些工具可能会显着有益于早期发展结果。索引术语:听力损失,语音分析,语音分类,WAV2VEC 2.0,计算听力学
摘要 - 世界许多地区无法获得心脏病资源的访问促使基于心脏信号的自动诊断系统的发展。近年来,已经提出了广泛的监督学习模型,可以从心脏声音中最初诊断为心脏病。为了达到高精度,这种监督的学习模型通常需要大量标记的数据,这可能是昂贵的。在这方面,最近已经采用了自我监督的学习来减少对注释数据的过度依赖。wav2Vec 2.0是一种音频自我监督的学习模型,在各种与语音有关的任务中显示出令人鼓舞的结果。在本文中,我们对WAV2VEC 2.0进行了调整,以从心脏声音信号中进行杂音检测。为此,我们在Circor Digiscope Heart Sound数据集上进行了预训练和微调。结果证实了使用WAV2VEC 2.0模型进行心脏声音分类的可行性。该模型通过实现0.80的加权精度和0.70的UAR来显示出竞争性能,用于在保留测试集中进行杂音检测。为了研究微调数据大小对下游性能的影响,我们还对小规模的带注释数据进行了微调2VEC 2.0模型。结果证实,该模型对小型微调数据大小具有鲁棒性,因此可以减少我们对大型,带注释的心脏声音数据的依赖。索引术语 - 心脏声音,杂音检测,WAV2VEC 2.0,自我监督学习
自我监督学的模型已被发现对诸如自动语音识别,说话者识别等的任务非常有效。但是,它们在言语增强系统中的效用尚未牢固确立,也许有些误解。在本文中,我们将使用SSL表示在具有挑战性的条件下用于增强单渠道语音的用途,并确定它们对增强任务的影响。我们的约束是围绕实时的实时语音增强设计的 - 模型是因果关系,并且计算足迹很小。此外,我们专注于低SNR条件,在这种情况下,这种模型难以提供良好的性能。索引术语:语音增强,WAV2VEC2,GCRN,预训练,知识蒸馏,调理
