小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
大规模识别大型语言模型中的交互

理解大型语言模型等复杂机器学习系统的行为是现代人工智能的一大挑战。可解释性研究旨在提高决策过程的透明度,采用特征归因、数据归因和机制可解释性等方法分析模型行为。然而,特征和数据量的增加使分析变得更加复杂。SPEX和ProxySPEX算法通过消融技术有效识别关键交互,推动了可解释性研究的发展。

大规模识别大型语言模型中的交互

The Berkeley Artificial Intelligence Research Blog The Berkeley Artificial Intelligence Research Blog · 2026-03-13T09:00:00Z

本研究解决了时间序列分类模型解释性不足的问题,揭示了扰动评价法在不同类别间的显著差异,并提出了带类感知惩罚项的评估框架,以更准确地评估特征归因效果。

评估时间序列归因中的类依赖扰动效应

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-24T00:00:00Z

本研究提出了一种新的成对Shapley值框架,旨在解决可解释人工智能中的可解释性和可扩展性问题。该方法通过比较特征归因与数据实例对,提供更直观的解释,降低计算开销,提升XAI的实际应用能力。

From Abstraction to Action: Pairwise Shapley Values for Explainable Artificial Intelligence

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-18T00:00:00Z

本研究探讨了上下文信息对物体识别模型准确性的影响,发现物体体积归因比上下文体积归因更显著,且上下文变化对模型性能的影响超出预期,为改进物体识别模型提供了新见解。

Lost in Context: The Impact of Context on Feature Attribution Methods for Object Recognition

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-11-05T00:00:00Z

该研究提出了一个基准测试框架,用于评估特征归因方法的效果,强调忠实度和可靠性。通过数学系统统一14种归因方法,提出基于贝叶斯视角的训练数据归因技术,并开发了开源库“dattri”,以简化数据归因分析,提升AI性能与安全性。

Quanda:用于训练数据归因评估及其应用的可解释性工具包

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-09T00:00:00Z

本研究通过引入Shapley交互(SIs)解决了Shapley值在特征归因和数据估值中的局限性,提升了对黑箱模型的理解。shapiq是一个开源Python包,整合算法,高效计算Shapley值和SIs,并提供基准测试工具评估性能。

shapiq: Shapley Interactions for Machine Learning

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-02T00:00:00Z

本文全面概述了计算机视觉中的可解释人工智能(XAI)方法,探讨了特征归因的挑战与进展,包括正式特征归因(FFA)和校准解释(CE)等新方法。研究表明,基于高斯过程回归的特征归因方法在准确性和计算成本上优于现有近似方法,强调了解释模型在高风险决策中的重要性及应用。

通过特征归因增强AI回归任务中的特征选择和可解释性

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-25T00:00:00Z

该研究提出了一种新型范式FAR,通过最小化属性映射的最大差异来训练模型的鲁棒属性。实验表明,该方法在对抗干扰下更稳健,并引入新的正则器以提高归因鲁棒性。此外,研究还提出了积分梯度正则化(IGR)方法,增强模型的对抗性,探索特征归因法的泛化能力及其在深度学习中的应用。

标准化的AOPC:修正特征归因可解释性中误导性的忠实度指标

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-08-15T00:00:00Z

本文介绍了十种特征归因方法,包括七种依赖类别的方法和三种分布感知的方法。提出了SHAP-KL和FastSHAP-KL两种新方法,并在多个临床数据集上评估了其在特征选择和模型解释中的有效性。

可解释机器学习预测的无标签或特征泄漏的本地特征选择

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-16T00:00:00Z

本文探讨了特征归因方法在神经网络中的应用,提出了PEAR模型训练方法以提高解释一致性。研究比较了多种特征归因和注意力方法,发现注意力方法的关联度较低,建议停止使用等级相关性作为评估指标。此外,提出了新的评估方案以提高图像归因方法的可信度,并探讨了渐变解释性方法的鲁棒性及其局限性。

神经网络特征评估中的不一致问题探究

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-04-17T00:00:00Z

本文提出了一种领域特定的特征归因框架,利用深度学习和可解释人工智能(XAI)技术检测滚动轴承故障,增强模型的可理解性。研究评估了八种XAI算法在医学图像分析中的应用,探讨了其局限性及未来改进方向,旨在建立可信的深度学习模型。

准确故障检测和诊断的可解释人工智能技术综述

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-04-17T00:00:00Z

最近的研究发现亚空间干预可以同时操纵模型行为和将特征归因于给定亚空间,但这两个目标是不同的,可能会导致虚假的解释感觉。研究还展示了实践中支持该现象普遍存在的证据。然而,亚空间激活干预在可解释性方面仍然适用。

对 Makelov 等人(2023 年)的 “可解释性幻觉” 论点的回应

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-01-23T00:00:00Z

最近的研究发现亚空间干预可以同时操纵模型行为和将特征归因于给定亚空间,但这两个目标是不同的,可能导致虚假解释感觉。研究还发现亚空间干预可能是通过激活与模型输出因果断开的并行路径来实现的。然而,这并不意味着亚空间激活干预在可解释性方面本质上不适用。研究还探讨了需要的额外证据来论证修补的亚空间是否忠实。

Patchscope:语言模型隐藏表示的统一检查框架

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-01-11T00:00:00Z

该文介绍了一种新的特征归因方法CAFE,能更好地识别合成表格数据中的冲突特征,具有最好的整体保真度和高的计算效率。该方法解决了现有方法中的三个限制,增强了鲁棒性,并增加了表面冲突特征的能力。

冲突感知特征解释

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-10-31T00:00:00Z

该研究提出了一种新的深度表格数据学习架构TabNet,采用顺序注意方法选择推理特征,实现了可解释性和更高效的学习。在各种表格数据集上,TabNet胜过其他神经网络和决策树变体,并提供了可解释的特征归因和对全局模型行为的深入认识。此外,该研究还展示了在未标记的数据丰富情况下,自监督学习可以显著提高性能。

基于神经网络的带真值表的规则模型

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-09-18T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码