对 Makelov 等人(2023 年)的 “可解释性幻觉” 论点的回应

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

最近的研究发现亚空间干预可以同时操纵模型行为和将特征归因于给定亚空间,但这两个目标是不同的,可能会导致虚假的解释感觉。研究还展示了实践中支持该现象普遍存在的证据。然而,亚空间激活干预在可解释性方面仍然适用。

🏷️

标签

➡️

继续阅读