Sparse Weight Decomposition Extracts Interpretable Units from Pretrained Weights with <1% Data
IQuest Research and collaborators introduced Sparse Weight Decomposition (SWD), a method that decomposes dense weight matrices into two sparse matrices, creating bottleneck units that can be independently scored, selected, and ablated without training a separate replacement network. In experiments, SWD used less than 1% of the data required by training-based baselines like Transcoder while achieving comparable replacement fidelity, and scaled to GPT-2, Qwen2.5, and Qwen3.5-27B, including all 48 attention and MLP weight matrices of GPT-2 Small, with a zero-data version available.
Coverage timeline
量子位量子位
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1% 思邈 2026-08-15 14:42:23 来源: 量子位 理解大模型,无需再训练一个替代网络 允中 发自 凹非寺 量子位 | 公众号 QbitAI 大模型机制可解释性研究中,一直存在一个颇具反差的现实: 为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。 Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。 这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。 说白了,研究者想打开一个黑箱,却往往需要先训练另一个“小黑箱”。 问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。 训练型替代表示通常还需要针对不同模型、层和checkpoint分别拟合,使大规模、系统性的回路分析更加困难。 更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。 至知创新研究院(IQuest Research) 与Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线: 不再训练一套独立替代网络,而是从现有的预训练权重中直接“拆”出可干预单元。 这套方法名为 稀疏权重分解 (Sparse Weight Decomposition,SWD)。 它把一个稠密权重矩阵分解为两个稀疏矩阵,并把二者共享的中间维度变成可独立评分、选择和消融的瓶颈单元。研究者由此可以直接在权重上抽取任务回路。 论文给出了三个值得关注的结果: 在匹配替换保真度的单矩阵实验中,SWD使用的数据 不到Transcoder等训练型基线的1% ; 在GPT-2、Qwen2.5和Qwen3.5-27B的任务回路实验中,SWD通常以 更少的瓶颈单元和活跃连接 达到相同的充分性、必要性目标; 方法不仅扩展到了27B模型,还覆盖了GPT-2 Small 全部48个注意力和MLP权重矩阵 ,并提供了完全不需要校准文本的zero-data版本。 论文地址:https://arxiv.org/abs/2608
