内容提要
该文介绍了一种新方法“稀疏权重分解”(SWD),用于直接分解预训练大模型的权重矩阵,无需训练替代网络。SWD将稠密权重分解为两个稀疏矩阵,形成可独立干预的瓶颈单元,从而高效抽取任务回路。实验表明,SWD在GPT-2、Qwen等模型上,以不到1%的数据成本实现高保真替换,并通过充分性和必要性测试,支持语义审计和定向编辑,为机制可解释性提供了轻量、可扩展的路径。
延伸解读
SWD与SVD的关键差异
SWD与SVD都可将权重矩阵分解为低秩成分,但SWD额外施加了稀疏性约束,使每个瓶颈单元的读写连接仅涉及少量维度。相比之下,SVD成分的读写方向通常是稠密的,即使保留少数成分也可能连接几乎所有输入输出维度。因此,SWD在因果测试中能以更少的活跃连接达到同等效果,说明稀疏结构本身对回路分析至关重要。
数据成本优势的验证范围
论文在GPT-2 Small、Qwen2.5系列及Qwen3.5-27B上验证了SWD的数据效率,单矩阵替换时仅需数千校准token即可达到低CE误差,而训练型基线需约10^6量级token。全模型替换时,SWD-FT使用约2060万token,而稀疏预训练基线使用28.84亿token,均不到1%。但需注意,这些结果基于特定模型和层,实际应用时可能因模型架构和任务不同而有所差异。
从分解到可干预的回路
SWD不仅提供低误差近似,还通过充分性和必要性测试验证了瓶颈单元的可干预性。在GPT-2 Small的GreaterThan、IOI等任务上,SWD达到相同因果要求时所需单元和活跃连接更少。此外,单个瓶颈方向可用于定向编辑,如c205单元在“The opposite of up is”任务中提升正确答案的logit margin,且副作用极小。这表明SWD单元可作为精确操控模型行为的编辑手柄。
Q&A
什么是稀疏权重分解(SWD)?它如何工作?
SWD是一种直接分解预训练大模型权重矩阵的方法,无需训练替代网络。它将稠密权重矩阵W分解为两个稀疏矩阵A和B,使得W≈AB,共享的中间维度形成可独立干预的瓶颈单元。分解时使用少量校准文本优化输出误差,交替更新因子并通过硬阈值维持稀疏性。
SWD相比传统方法(如Transcoder)有什么优势?
SWD无需训练替代网络,数据成本不到传统方法的1%,且分解出的瓶颈单元具有稀疏读写结构,能以更少的活跃连接达到相同的任务表现,支持更高效的回路分析。
SWD如何保证分解后的模型行为与原模型一致?
SWD通过最小化分解前后的输出误差(如交叉熵差值CE delta)来保证保真度,并使用KL散度和激活重构误差进行验证。实验表明,SWD在GPT-2和Qwen模型上能以少量校准数据达到低CE误差,接近原模型行为。
SWD如何抽取任务回路?
SWD将权重分解为瓶颈单元后,使用一阶任务归因对单元排序,选择top-k单元组成任务回路。通过充分性测试(保留这些单元任务仍存在)和必要性测试(移除这些单元任务下降)验证回路的有效性。
SWD在哪些模型上进行了验证?效果如何?
SWD在GPT-2 Small、Qwen2.5-0.5B/1.5B/3B和Qwen3.5-27B上验证。在GPT-2 Small上,SWD以更少数据和活跃连接达到相同任务表现;在Qwen3.5-27B上,SWD仍能以较少活跃连接达到因果测试要求。
SWD能否用于全模型替换?
可以。团队将GPT-2 Small全部48个注意力和MLP权重矩阵替换为稀疏分解,并通过微调保留的非零值(SWD-FT)将模型CE从3.90降至3.44,且数据成本不到稀疏预训练基线的1%。
SWD的zero-data版本是什么?有什么意义?
zero-data SWD完全不使用校准文本,直接最小化Frobenius误差。它在权重空间中更接近原矩阵,且仍能抽取有效任务回路,为逐checkpoint追踪模型结构提供了可能。
SWD的瓶颈单元能否用于语义审计和定向编辑?
能。在GreaterThan任务中,高归因单元多与数字、数量相关,语义模式与任务能力呼应。定向编辑实验表明,单个瓶颈方向可精确改变模型行为,副作用低于随机单元和LoRA对照。