Transformer 架构的限制

💡 原文中文,约1700字,阅读约需5分钟。
📝

内容提要

多项研究探讨大语言模型的局限:Transformer在复合任务上仅做线性子图匹配,组合能力有限,复杂度增加时性能快速下降;模型无法学习所有可计算函数,幻觉不可避免。研究还提出数据增强框架提升组合泛化,并综述幻觉的分类、成因、检测与缓解方法。

🔎

延伸解读

组合泛化:架构与数据的双重挑战

文章指出,Transformer在复合任务上仅进行线性子图匹配,组合能力有限,且性能随复杂度增加而快速下降。同时,有研究通过数据增强框架提升组合泛化,在CLEVR-CoGenT和COGS等基准上取得进展。这表明,提升组合泛化需要同时考虑模型架构的归纳偏置和训练数据的分布设计,而非单纯扩大规模。

幻觉的不可避免性:理论视角

文章引用研究证明,由于语言模型无法学习所有可计算函数,幻觉在形式上不可避免。这意味着幻觉并非单纯的工程缺陷,而是模型能力边界的一种体现。现有缓解方法可能只能减少特定类型的幻觉,而无法根除。这对安全部署大语言模型提出了根本性挑战,需要在实际应用中设置合理的预期和防护措施。

规模与泛化的反比例尺律

文章提到,在涉及抽象符号的关系推理任务中,Transformer表现出“反比例尺律”:随着嵌入维度增加,模型反而无法泛化。这挑战了“越大越好”的直觉,提示模型容量与泛化能力之间可能存在权衡。研究还提出通过微调每个注意力头来减少数据需求,这为设计更高效的Transformer变体提供了方向。

❓

Q&A

Transformer 模型在处理复合任务时有什么局限性?

Transformer 模型在复合任务上仅做线性子图匹配,组合能力有限,随着任务复杂度增加,性能会快速下降。

为什么大型语言模型无法避免幻觉?

因为语言模型无法学习所有的可计算函数,所以它们将始终产生幻觉,消除幻觉是不可能的。

有哪些方法可以提升Transformer的组合泛化能力?

可以通过数据增强框架,利用数据转换函数生成新的训练例子,以及对Transformer进行修改(如每个头部添加两个可训练参数)来减少所需数据量,从而提升组合泛化能力。

Transformer 在关系推理任务中的表现如何?

对于回归任务,Transformer 在训练时具有泛化性但需要大量训练数据;对于下一个令牌预测任务,随着嵌入维度的增加,Transformer 无法泛化,呈现“反比例尺律”。

导致大型语言模型产生幻觉的主要因素是什么?

训练数据的记忆和频率偏好是导致生成式大型语言模型产生幻觉的两个主要因素。

深度模型和浅层模型在组合性泛化上有什么差异?

深度模型相比浅层模型能更好地进行组合性泛化,并且在语言建模性能上表现更好。

🏷️

标签

➡️

继续阅读