FLEURS-R:用于生成任务的恢复多语言语音语料库

💡 原文中文,约1800字,阅读约需5分钟。
📝

内容提要

本文介绍了多种语音处理技术和语料库的开发,如LibriSpeech、FlauBERT和XLS-R,旨在提升语音翻译和识别性能。研究者们创建了公开的语音训练语料库LibriS2S和GigaSpeech 2,以解决数据不足的问题,并通过自我监督模型和多语言预训练,推动低资源语言的语音技术发展。

🔎

延伸解读

多语言语音技术的演进脉络

文章按时间顺序梳理了从2018年到2024年语音处理领域的关键进展,包括LibriSpeech增强、FlauBERT、XLS-R、LibriS2S、FLEURS、FlauBERT-Oral、非洲语言自监督模型、7000种语言TTS和GigaSpeech 2。这些工作共同指向一个趋势:通过大规模预训练、自监督学习和数据增强,逐步解决低资源语言的语音任务数据稀缺问题。

低资源语言语音识别的突破

针对低资源语言,文章介绍了多个专门项目:非洲语言自监督模型仅用6万小时无标签语音和0.09B参数,在FLEURS-102的SSA子集上达到与0.6B模型相当的ASR性能,且LID准确率提升22%;GigaSpeech 2不依赖配对数据,在泰语、印尼语和越南语上比Whisper large-v3降低25%至40%的词错误率。这些成果表明,高效利用无标签数据和自动化流程能显著提升低资源语言识别效果。

口语语言模型与语音翻译的进展

文章提到利用ASR自动转录大规模语音来训练口语语言模型FlauBERT-Oral,尽管转录文本有噪音,但在口语理解等任务上仍优于初始化版本。同时,LibriS2S语料库的创建解决了语音到语音翻译训练数据缺乏的问题,并基于FastSpeech 2提出了直接根据源语言发音生成语音的模型。这些工作为口语翻译和语音合成提供了新思路。

❓

Q&A

LibriSpeech如何增强现有的单语语料库?

LibriSpeech通过建立包含源语言语音与目标语言文本的大型开放式平行语料库,增强现有单语语料库。

FlauBERT模型的训练数据来源是什么?

FlauBERT模型在大规模的异构法语语料库上进行训练。

XLS-R模型的主要特点是什么?

XLS-R是基于Wav2vec 2.0的跨语言语音表示学习模型,训练于128种语言的近半百万小时公开语音数据。

LibriS2S语料库的目的是什么?

LibriS2S语料库旨在解决语音到语音翻译领域缺乏培训数据的问题。

FLEURS基准包含多少种语言的数据集?

FLEURS基准包含102种语言的并行语音数据集。

GigaSpeech 2语音识别语料库的特点是什么?

GigaSpeech 2是为低资源语言设计的大规模、多领域、多语种的语音识别语料库,不依赖于配对的语音和文本数据。

🏷️

标签

➡️

继续阅读