该文介绍了一种新方法“稀疏权重分解”(SWD),用于直接分解预训练大模型的权重矩阵,无需训练替代网络。SWD将稠密权重分解为两个稀疏矩阵,形成可独立干预的瓶颈单元,从而高效抽取任务回路。实验表明,SWD在GPT-2、Qwen等模型上,以不到1%的数据成本实现高保真替换,并通过充分性和必要性测试,支持语义审计和定向编辑,为机制可解释性提供了轻量、可扩展的路径。
完成下面两步后,将自动完成登录并继续当前操作。