音频的关键词检索结果

使用专用模型重新审视 ASR 纠错

Revisiting ASR Error Correction with Specialized Models

语言模型在自动语音识别 (ASR) 中发挥着核心作用,但大多数方法依赖于纯文本模型,不知道 ASR 错误模式。最近,大型语言模型 (LLM) 已应用于 ASR 校正,但引入了延迟和幻觉问题。我们使用紧凑的 seq2seq 模型重新审视 ASR 纠错,该模型针对真实和合成音频的 ASR 错误进行训练。为了扩展训练,我们通过级联 TTS 和 ASR 构建合成语料库,发现匹配现实错误分布的多样性是关键。我们提出校正优先解码,其中校正......

通过高级模态条件和交互来驯服文本到声音视频的生成

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

这项研究的重点是文本到声音视频 (T2SV) 生成,旨在生成具有文本同步音频的视频,两种模式都与文本条件一致。尽管联合音视频训练取得了进展,但仍然存在两个关键挑战:(1)文本调节是一个瓶颈——共享字幕(TV = TA)触发模态干扰,而密集的训练字幕和简洁的推理用户提示之间仍然存在差距;(2)跨模态特征交互的最佳融合机制仍不清楚。为了解决第一个挑战,我们首先提出......

Sadananda Gowda 拒绝对讨论罢免卡纳塔克邦人民党主席 Vijayendra 的音频发表评论

Sadananda Gowda declines to comment on audio discussing removal of Karnataka BJP chief Vijayendra

前卡纳塔克邦 CM D V Sadananda Gowda 拒绝对泄露的音频发表评论,该音频据称讨论了印度人民党州主席 B Y Vijayendra 的罢免。 Gowda 质疑音频的真实性,认为它可能是人工智能生成的,也可能是“付费电视频道”的诽谤活动。