神经网络特征评估中的不一致问题探究
内容提要
本文探讨了特征归因方法在神经网络中的应用,提出了PEAR模型训练方法以提高解释一致性。研究比较了多种特征归因和注意力方法,发现注意力方法的关联度较低,建议停止使用等级相关性作为评估指标。此外,提出了新的评估方案以提高图像归因方法的可信度,并探讨了渐变解释性方法的鲁棒性及其局限性。
延伸解读
注意力方法评估的警示
文章指出,在两种NLP任务和两种模型上比较五种特征归因方法与两种注意力方法时,发现注意力方法与其他归因方法的等级相关性较低。因此,作者建议停止使用等级相关性作为注意力解释的评估指标。这一发现提醒研究者和实践者,在评估注意力解释时需谨慎选择指标,避免因指标不当而得出误导性结论。
PEAR训练方法的价值
PEAR是一种模型训练方法,它在考虑精确度的同时,引入了一个衡量不同特征影响之间差异的项,旨在提高基于后续特征影响的解释器对未见数据的一致性。研究表明,该方法对特征归因解释具有积极影响。这为提升解释器在未知数据上的稳定性提供了一种可行的训练策略。
解释对人类操纵模型的影响
通过众包实验发现,在给定特征系数的情况下,人们能更有效地操纵线性词袋模型,但解释对BERT型分类器并没有显著提高操纵能力。然而,通过伪造BERT模型的线性模型对全局归属的解释,则可以有效地操作BERT型模型。这表明解释的作用因模型类型而异,且伪造解释可能带来安全风险。
图神经网络归因评估的局限
研究通过重新训练网络来评估图神经网络归因方法,揭示了归因方法在不同数据集和网络上的可变性,并发现GNNExplainer与任意边重要性指定方法表现相似。因此,重新训练评估不能作为广义基准,而应作为一种工具集来评估特定网络、数据集和稀疏度上的归因。这强调了评估需结合具体场景。
Q&A
PEAR模型训练方法的主要作用是什么?
PEAR模型训练方法通过引入衡量特征影响差异的项,提高了解释器对未见数据的一致性。
为什么建议停止使用等级相关性作为注意力解释的评估指标?
研究发现注意力方法与其他特征归因方法的关联度较低,因此建议停止使用等级相关性作为评估指标。
特征归因法在不同深度学习架构中的泛化能力如何?
研究检验了特征归因法在不同深度学习架构模型间的泛化能力,探索了归一化特征解释方法的潜力。
众包实验的结果对BERT型分类器的解释能力有什么发现?
众包实验发现,解释对BERT型分类器的操纵能力没有显著提高,但伪造线性模型的解释可以有效操作BERT模型。
如何评估图神经网络归因方法的可变性?
通过重新训练网络来评估图神经网络归因方法,发现GNNExplainer与任意边重要性指定方法表现相似。
文章中提出了哪些新的评估方案?
文章提出了三种评估方案,以更可靠地衡量不同的图像归因方法的可信度,并提出后处理平滑步骤以提高性能。