大规模综合监督的跨语言开放领域问答预训练

💡 原文中文,约1500字,阅读约需4分钟。
📝

内容提要

该文综述多语言问答研究,涵盖合成数据生成、机器翻译增强、语言对抗训练与仲裁框架等方法,以提升低资源语言表现;提出MLQA跨语言评测基准;并探索利用预训练模型隐含知识及外部知识库增强常识问答,在多个数据集上取得最优结果。

🔎

延伸解读

合成数据与机器翻译增强

文章介绍了利用平行语料库进行间接监督的合成数据生成方法,并通过词汇约束的机器翻译提高翻译质量,生成了跨4种语言的662K问答样例。消融研究表明,该方法对自动单词对齐的噪声具有稳健性。此外,还有研究使用问答生成模型以跨语言方式生成合成数据,无需额外标注,在四个多语言数据集上显著优于仅用英文数据的基线。

语言对抗训练与仲裁框架

为提高多语言问答的跨语言迁移性能,文章提到两种新颖策略:语言对抗性训练和语言仲裁框架。这些策略显著提升了零资源跨语言迁移性能,并使语言模型嵌入不那么语言特定。经验证明,这些模型在MLQA和TyDiQA数据集上优于之前的零样本基线。

MLQA基准与常识问答增强

文章提出了MLQA多语言提取式问答评估基准,包含7种语言的问答实例,基于维基百科文章构建,采用新颖的对齐上下文策略。在常识问答方面,研究利用预训练语言模型中的隐含知识,通过四种翻译方法调动常识知识,在零样本情况下对三个CQA数据集实验,证明能有效增强模型性能,结合外部知识库可进一步提升。

❓

Q&A

跨语言开放域问答中,如何利用合成数据提升低资源语言的表现?

文章提到使用问答生成模型以跨语言方式生成合成数据,无需额外标注数据,并在四个多语言数据集上显著优于仅用英文数据的基线,创造了新的最优性能。

MLQA基准是什么?它包含哪些语言?

MLQA是一个多语言提取式问答评估基准,包含7种语言的QA实例,基于Wikipedia文章构建,旨在推动跨语言QA研究。

有哪些策略可以提高零资源跨语言迁移的性能?

文章提出了两种新颖策略:语言对抗性训练和语言仲裁框架,这些策略显著提高了零资源的交叉语言转移性能,并使LM嵌入不那么语言特定。

如何利用预训练语言模型中的隐含知识来增强常识问答?

文章提出利用预训练语言模型中的“隐含知识”,通过四种翻译方法调动常识知识,在零样本情况下对三个CQA数据集实验证明有效,结合外部知识库可进一步提高性能。

在跨语言问答中,机器翻译增强是如何应用的?

文章使用机器翻译生成的数据来增强原始英语训练数据,并采用词汇约束的机器翻译提高翻译质量,生成了跨越4种语言的662K QA样例数据集。

QAN模型在答案选择任务上取得了什么成果?

QAN模型在SemEval2015和SemEval2017数据集上实现了最新的性能,同时利用大型语言模型进行知识增强的答案选择,通过优化提示提高了正确答案选择率。

🏷️

标签

➡️

继续阅读