BERT 模型中的注意力分数对 GLUE 基准上的句法和语义任务中的词类意识研究

💡 原文中文,约1400字,阅读约需4分钟。
📝

内容提要

本文提出了一种基于句法结构的局部语义注意力机制,结合BERT等预训练模型,提升了句法相关词的关注度。研究表明,BERT的注意力机制与语法和指代密切相关,并在不同任务中表现出遗忘、强化或保留的特征。通过多语言BERT的实验,发现注意力模式有效代表语言结构,新模型在关系分类和问答任务中表现优异。

🔎

延伸解读

注意力头与语法知识的关联

文章指出,BERT的注意力头与语法和指代密切相关,某些头能高精度表示动词的直接宾语、名词限定词和介词宾语。这表明预训练模型在无监督学习中隐式捕获了句法结构,为利用注意力进行语法分析提供了依据。

微调对句法信息的影响

在六种任务微调中,编码的语法信息呈现不同演变:词性标注任务中语法信息被遗忘,依存句法和组成成句任务中被强化,语义相关任务中则保留。这提示微调目标会影响模型对句法知识的保持程度。

多语言与层次结构编码

多语言BERT实验显示,单一注意力头能以高准确率解码依存树,注意力模式可代表语言结构。此外,BERT在较低层次编码位置信息,较高层次编码层次结构,模拟了语言层次性,但处理反身代词的敏感性弱于人类。

注意力机制的可调控性

由于超参数化导致自注意力机制复用率高,不同机制对不同NLP任务影响各异。针对性关闭某些自注意力机制可提升模型性能,这为模型优化提供了新思路,但也需注意任务特异性。

❓

Q&A

BERT模型的注意力机制如何与语法和指代相关联?

BERT的注意力机制与语言的语法和指代密切相关,某些注意力头能够高精度表示动词的直接宾语等。

新提出的局部语义注意力机制有什么优势?

该机制结合BERT等预训练模型,提高了句法相关词的关注度,在任务中实现了一致性增益。

BERT在不同任务中编码的语法信息表现如何?

编码的语法信息在不同任务中表现出遗忘、强化或保留的特征。

多语言BERT的实验结果如何?

实验表明,注意力模式有效代表语言结构,单一注意力头可以以上线准确率解码全树。

BERT模型如何处理上下文中的词汇线索?

BERT在上下文中使用词汇线索来确定单词概率,强调上下文约束效应的重要性。

BERT和RoBERTa中的注意力头有什么不同?

某些注意力头比基线更好地诱导语法类型,且Fine-tuning后能力变化。

🏷️

标签

➡️

继续阅读