小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本文探讨Transformer模型的可解释性,核心在于区分解释的“合理性”与“忠实性”。注意力权重高并不等同于因果贡献大,梯度、遮挡和探针等方法各有局限,只能证明信息存在而非被实际使用。大语言模型的自我解释(如思维链)常听起来合理但不忠实,对齐训练可能加剧这一问题。文章强调需结合多层证据,避免将表面解释误认为真实机制。

【Transformer 与注意力机制】52|可解释性入门:注意力权重真的是“解释”吗

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z

本文探讨机制可解释性,强调电路分析需基于因果证据而非标签。通过induction head和IOI电路案例,说明激活修补可提供因果证据但可能产生幻觉。叠加现象使单神经元解释不可靠,稀疏自编码器可扩展但特征不完整。该方法对AI安全有工具价值,但尚不能完整解释模型。

【Transformer 与注意力机制】53|机制可解释性:电路、诱导头与叠加态的边界

土法炼钢兴趣小组的博客
土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
语言模型中的全局工作空间:Anthropic最新可解释性发现

Anthropic的研究揭示了Claude语言模型中的“J空间”,这是一个激活少量概念以进行推理的小型工作区。研究发现Claude能够在心中记住概念而不影响输出,并能识别“虚假”标签,显示其对监控的意识。删除J空间后,Claude在复杂推理中的表现显著下降。这一发现对AI的可解释性和安全性具有重要意义,可能影响未来的AI对齐和隐私讨论。

语言模型中的全局工作空间:Anthropic最新可解释性发现

极道
极道 · 2026-07-06T23:53:00Z
理解注释员安全政策及其可解释性

本文讨论了注释员安全政策的重要性及其可解释性。安全政策指导数据注释和模型开发,但注释员之间常存在分歧,可能源于操作失误、政策模糊或价值观差异。为了解决这些问题,提出了注释员政策模型(APMs),通过分析注释行为来学习注释员的内部安全政策,帮助识别分歧来源,支持更透明和包容的安全政策设计。

理解注释员安全政策及其可解释性

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-06T00:00:00Z
大语言模型神经几何学机械可解释性完全指南

大语言模型(如ChatGPT)通过几何形状进行思考,神经几何学研究这些形状的排列,帮助我们理解模型的决策过程。分析模型的几何结构可以精准定位错误、主动控制行为,并实时监控智能体。这种方法使修复模型错误变得简单有效,确保AI的诚实与有用性。理解AI的几何形状是掌控其思维的关键。

大语言模型神经几何学机械可解释性完全指南

极道
极道 · 2026-06-16T02:51:00Z

文章讨论了大语言模型(LLM)的可解释性,强调动态评估的重要性。尽管LLM在AI领域取得了突破,其内部运作仍不透明。研究者提出了基于SMILE的框架,通过分析用户输入的细微变化,提供模型决策的局部解释。同时,开发了使用开源模型的代理解决方案,以降低成本并实现模型可解释性。随着技术进步,LLM的可解释性正在快速发展,推动更可信的AI模型。

大语言模型可解释性入门

KDnuggets
KDnuggets · 2026-06-02T14:00:18Z
大模型哪里出问题、怎么修,这篇可解释性综述一次讲清

文章讨论了人工智能在候选人筛选中的应用,强调其提升招聘效率和准确性的潜力,同时指出了可能存在的偏见和伦理问题。

大模型哪里出问题、怎么修,这篇可解释性综述一次讲清

机器之心
机器之心 · 2026-01-27T05:04:34Z
面向临床的心电图AI,上智院、复旦等提出CLEAR-HUG框架实现诊断性能与可解释性双突破

抱歉,提供的文本内容过于简短,无法有效总结。请提供更多信息或更长的文本。

面向临床的心电图AI,上智院、复旦等提出CLEAR-HUG框架实现诊断性能与可解释性双突破

机器之心
机器之心 · 2026-01-16T06:04:00Z
「地质约束显式+数据驱动模型」的新路径,浙江大学团队实现跨区域矿产远景预测性能和可解释性提升

浙江大学研究团队提出了一种基于地质约束的数据驱动成矿预测方法,通过引入各向异性空间关系,显著提升了矿产远景预测的地质一致性与可解释性。该方法在加拿大和美国的多尺度验证中表现优异,揭示了关键控矿因素,为智能找矿开辟了新路径。

「地质约束显式+数据驱动模型」的新路径,浙江大学团队实现跨区域矿产远景预测性能和可解释性提升

HyperAI超神经
HyperAI超神经 · 2025-12-30T08:42:52Z
ExpertLens:激活引导特征具有高度可解释性

本文探讨了激活引导方法在大型语言模型中的应用,旨在通过识别特定概念的神经元来增强生成语言的可解释性。研究表明,ExpertLens能够稳定捕捉模型表示,并与人类行为数据高度一致,超越传统的词/句嵌入对齐方式,显示出其作为分析模型表示的灵活性和轻量性。

ExpertLens:激活引导特征具有高度可解释性

Apple Machine Learning Research
Apple Machine Learning Research · 2025-11-07T00:00:00Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

兼顾准确率与可解释性,DeepSEA实现抗生素耐药蛋白注释范式转变

机器之心
机器之心 · 2025-09-11T06:29:05Z
演讲:通过知识图谱提升大语言模型的可解释性和可信度

知识图谱是结构化数据的集合,有助于提升大语言模型(LLM)的可解释性和准确性。LLM面临幻觉现象和信息丢失的挑战,结合知识图谱后,LLM能够更好地理解问题并提供准确的信息。

演讲:通过知识图谱提升大语言模型的可解释性和可信度

InfoQ
InfoQ · 2025-07-22T13:31:00Z

机器之心数据服务现已上线,提供高效稳定的数据获取服务,帮助用户轻松获取所需数据。

会“思考”的目标检测模型来了!IDEA提出Rex-Thinker:基于思维链的指代物体检测模型,准确率+可解释性双突破

机器之心
机器之心 · 2025-06-30T10:41:10Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

首个统一的图像与视频AIGC可解释性检测框架,多榜单SOTA性能

机器之心
机器之心 · 2025-06-15T11:40:51Z

本文探讨了软件工程中深度学习的因果可解释性,提出了新方法DoCode,通过因果推断为模型预测提供编程语言相关的解释,促进可信人工智能在软件工程中的应用。

深化软件工程中深度学习的因果可解释性研究

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z
在生成式人工智能驱动的质量保证中建立信任:确保透明性和可解释性

生成式人工智能(GenAI)正在加速质量保证(QA)进程,但团队对其信任仍面临挑战。建立信任需关注数据隐私和AI输出的可靠性,企业应确保数据匿名化,避免敏感信息泄露,并保持人类监督以防错误。AI应作为人类助手,提升工作效率。通过透明沟通和培训,团队能更好适应AI工具,实现更高效的软件交付。

在生成式人工智能驱动的质量保证中建立信任:确保透明性和可解释性

The New Stack
The New Stack · 2025-05-16T12:00:01Z
计算机视觉前沿:深度人工智能时代的可解释性、效率、鲁棒性与统一学习

本文总结了2025年5月10日发布的十六篇计算机视觉研究论文,重点讨论了可解释性、弱监督学习、模型效率和安全性等主题。这些研究推动了计算机视觉的理论与实践发展,并促进了其在医疗和安防等领域的应用。

计算机视觉前沿:深度人工智能时代的可解释性、效率、鲁棒性与统一学习

DEV Community
DEV Community · 2025-05-13T07:49:56Z

本研究解决了时间序列分类的可解释性问题,提出了新的评估指标,发现简化时间序列在可解释性上优于原始数据,尤其在季节性和非平稳序列中表现更佳。

评估时间序列分类的简化算法的可解释性

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-05-13T00:00:00Z

本研究解决了现有深度学习模型在轨迹预测中预测不可信和不合理的问题。我们提出了一种新方法,结合了所有交通参与者类别的交互和运动学先验,通过特定于类别的交互层来捕捉行为差异,同时引入了基于规则的交互重要性评分DG-SFM,以提高交互的可解释性。实验结果表明,尽管准确率略有下降,但我们的方法消除了数据集中不合理的轨迹,从而增强了轨迹预测的可信度。

TPK:集成先验知识的可信轨迹预测以提高可解释性和运动学合理性

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-05-10T00:00:00Z

本研究针对自然语言处理(NLP)模型的可解释性问题,提出EvalxNLP框架,以评估各种最新特征归因方法。该框架集成了多种可解释性技术,并提供互动的文本解释,以提高用户对生成说明和评估结果的理解,结果显示用户满意度高,表明该框架在可解释性工具的推广和比较方面具有重要潜力。

EvalxNLP:一个用于评估NLP模型后置可解释性方法的框架

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-05-02T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码