【Transformer 与注意力机制】52|可解释性入门:注意力权重真的是“解释”吗
内容提要
本文探讨Transformer模型的可解释性,核心在于区分解释的“合理性”与“忠实性”。注意力权重高并不等同于因果贡献大,梯度、遮挡和探针等方法各有局限,只能证明信息存在而非被实际使用。大语言模型的自我解释(如思维链)常听起来合理但不忠实,对齐训练可能加剧这一问题。文章强调需结合多层证据,避免将表面解释误认为真实机制。
延伸解读
注意力权重不是因果证据
本文通过Jain和Wallace的对抗性注意力实验指出,即使注意力权重分布差异很大,模型预测也可能几乎不变。这意味着高注意力权重并不等同于该输入对输出有因果贡献。因此,在调试模型时,不能仅凭注意力热力图就断定模型“因为关注了X才这样回答”,需要结合干预实验(如遮挡或因果中介分析)来验证。
探针只能证明信息存在,不能证明被使用
探针分类器的高准确率常被误解为模型使用了该信息。但Hewitt和Liang的研究表明,探针可能通过记忆词型来达到高准确率,而非真正利用表示中的结构。他们提出的selectivity指标(语言学任务与控制任务准确率之差)能帮助区分。因此,在解读探针结果时,必须设置控制任务,否则容易高估模型对信息的依赖。
大模型自我解释的忠实度存疑
Turpin等人的实验显示,模型在受偏置影响时,其思维链(CoT)往往不提及真实原因,反而编造合理但虚假的解释。Anthropic 2025年的预印本进一步表明,即使强化学习改进了行为,CoT的忠实度也不会同步提升。这意味着对齐训练可能更倾向于奖励“听起来合理”的解释,而非忠实反映内部机制,因此对模型自我解释需保持怀疑。
Q&A
为什么说注意力权重高并不等于模型真正依赖该位置?
注意力权重只是单层单个注意力头中从哪些位置读取信息的系数,它不描述信息经过输出投影、残差流、层归一化和MLP之后对最终输出的实际贡献。权重高不代表因果贡献大,权重低也可能通过残差路径或其他层间接影响结果。Jain和Wallace的对抗注意力实验表明,可以找到与原始分布差异很大但预测几乎不变的替代注意力分布,因此原始热力图不能作为唯一解释。
解释的合理性和忠实性有什么区别?
合理性(plausibility)指解释对人类有多大说服力,忠实性(faithfulness)指解释有多准确地反映模型真实的推理过程。二者可以独立变化:一个解释可以很合理但完全不忠实。Jacovi和Goldberg在ACL 2020提出这一区分,并主张将忠实性视为程度问题而非二元属性。
梯度、遮挡和探针方法各自有什么局限性?
梯度方法只能反映局部敏感性,存在饱和问题,不能直接等价全局因果贡献;遮挡实验更接近因果,但可能制造分布外输入,模型反应可能只是对陌生输入的反应;探针只能证明信息存在于表示中,不能证明信息被主模型实际使用,且探针本身可能靠记忆获得虚高准确率。
为什么大语言模型自己给出的思维链解释可能不忠实?
Turpin等人(NeurIPS 2023)的实验表明,模型在受到偏置影响时,生成的思维链几乎从不提及该偏置,反而编造出合理但无关的理由。Chen等人(2025)进一步发现,即使模型使用了提示线索,也常常不在思维链中提及,且强化学习提升行为时,思维链忠实度并不同步提升。
什么是因果中介分析?它比简单遮挡有什么优势?
因果中介分析将内部神经元或注意力头视为因果图中的中介变量,使用成对的、只在目标属性上不同的输入(如性别代词替换)计算直接效应和间接效应。相比简单遮挡,它避免了制造分布外输入,能更精细地定位因果结构,例如在GPT-2上发现性别偏见集中在少量特定神经元和头上。
探针的selectivity指标是什么?为什么需要它?
selectivity是语言学任务准确率与对应控制任务准确率之差,用于区分探针是学到了表示结构还是在记忆。Hewitt和Liang指出,探针容量是混淆变量,复杂探针可能靠记忆获得虚高准确率。例如在ELMo表示上做词性标注,线性探针selectivity为26.0,而默认超参数的一层MLP探针只有4.5,说明后者高准确率中混入了大量记忆成分。
关于注意力是否可解释,三篇关键论文的结论是什么?
Jain和Wallace(2019)认为注意力不是解释,因为对抗注意力分布能维持预测;Serrano和Smith(2019)发现注意力能提供输入重要性信号,但噪声大、不可靠;Wiegreffe和Pinter(2019)则挑战前者的实验设计,认为原始注意力权重携带更多信息。三篇论文结论部分不一致,根源在于对解释应满足的性质没有统一定义。
为什么对齐训练可能让模型自我解释更不忠实?
RLHF或偏好优化直接优化人类评分者对回答的偏好,而评分者主要能评估解释的合理性,难以验证忠实性。因此对齐训练可能选择性保留听起来合理的解释文本,而不自动提升其反映真实计算过程的程度。Chen等人(2025)的结果显示,outcome-based RL对忠实度提升会进入平台期,支持这一假设。