← 返回 PaperDaily 大模型与智能体

阿里开源百万级SAE:Qwen3黑箱被拆开了?

这篇论文最有意思的地方,不是“又训练了一个SAE”,而是把Qwen3的内部表示拆成了能看、能评、还能直接干预的特征字典。更妙的是,它不只讲“重构得像不像”,还真的拿拒答行为做了因果干预,实用味很足。

阿里开源百万级SAE:Qwen3黑箱被拆开了?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是“又训练了一个SAE”,而是把Qwen3的内部表示拆成了能看、能评、还能直接干预的特征字典。更妙的是,它不只讲“重构得像不像”,还真的拿拒答行为做了因果干预,实用味很足。


原论文信息如下:
论文标题:
Discovering Millions of Interpretable Features with Sparse Autoencoders
发表日期:
2026年06月
发表单位:
AI DATA, Alibaba Group Holding Limited; Beijing Institute of Technology
原文链接:
https://arxiv.org/pdf/2606.26620v1.pdf

大模型内部的黑箱如何打开?用稀疏自编码器“翻译”神经元活动,秒级定位拒绝行为,从Qwen3中提取百万级可解释特征,揭秘深度模型的“思维”模式

大模型最让人上头的地方,不是它会写诗、会答题,而是它明明很会,却又说不清自己到底怎么会的。这就像一个学霸,卷子永远满分,但你问他解题步骤,他只回一句“感觉”。
这篇论文做的事,正是给 Qwen3 的内部表示装了一本“翻译词典”。它用稀疏自编码器把原本混在一起的神经元活动拆成一个个更容易理解的特征,还进一步证明:这些特征不只是“看起来像”,甚至还能被拿来因果干预模型行为,比如把模型往“拒答”方向推一把。
封面
封面图:Qwen3-Instruct SAE 的开源特征谱系示意。论文不是在“再训一个小模型”,而是在给大模型做一套可解释的内部显微镜。

问题背景及相关工作

大模型内部并不是“一个神经元管一个概念”,更常见的是superposition(叠加)现象:一个方向里塞了好几个概念。为了拆开这种“混搭表示”,研究者提出了Sparse Autoencoder(SAE),学一个更大的“字典”,把每个输入拆成少量激活的特征再重构原表示。相关工作如 Gemma Scope、LlamaScope 已证明,把 SAE 做成公共资源对机械可解释性研究很有价值。本文的贡献,就是把这套方法推进到 Qwen3 指令模型家族上。
图1:开源SAE模型发布的时间线,展示了从早期探索到生态扩展的演进。本文的Qwen3-Instruct SAE将SAE分析扩展到了Qwen3指令微调模型家族。
图1:开源 SAE 模型发布的时间线,说明 SAE 正在变成一套通用研究基础设施。

术语解读

Residual stream残差流:transformer 层间传递信息的“主干道”。

MLP outputs多层感知机输出:存储和变换语义信息的重要位置。

Attention outputs注意力输出:负责把别的 token 的信息“拉过来”加工。

JumpReLU带阈值跳变的稀疏激活函数,让特征在阈值上方才“跳出来”。

DLLDelta LM loss,语言模型损失变化量,衡量替换激活后模型性能掉了多少。

FVEFraction of Variance Explained,解释方差比例,衡量 SAE 还原原表示的程度。

论文主体思路

*表格超出部分左右可以滑动
项目 内容
应用场景解释 Qwen3 指令模型内部表示,定位可解释特征,探索安全行为干预。
问题建模将模型激活表示视为可被稀疏字典分解的高维向量,用 SAE 学习“少量特征重构原表示”。
模型 Backbone 及选择原因Qwen3-1.7B、Qwen3-4B、Qwen3-8B 指令模型;选择 Qwen3 是因为其指令能力强,适合观察对齐与拒答行为。
损失函数重构损失 + 稀疏正则;JumpReLU 版本进一步用 L0 约束控制激活特征数。
训练数据集FineWeb-Edu 子集 Sample-10BT 的教育类文本。
测试数据集同分布评测集,保留约 1B tokens,评测上下文长度 1024。
训练方法在残差流、MLP 输出、注意力输出三个位置训练层级 SAE;1.7B 和 4B 覆盖全层,8B 先放出部分残差流层。
实验效果重构和性能恢复整体表现稳定;残差流与 MLP 通常优于注意力输出,且拒答干预能明显提升目标行为。
方法优势特征可解释、可评估、可干预,且提供了大规模公开字典资源。
方法缺点训练成本高;对 8B 只做了部分层;可解释性仍需人工与自动化结合验证。
这张表把论文主线一口气看明白:先训练字典,再评估重构,再拿特征做干预
图2:Qwen3模型一个transformer块内的三种SAE训练位置示意图。
图2:三种训练位置——残差流、MLP 输出、注意力输出,分别代表不同的信息通道。

核心设计

SAE 的基本工作方式:输入模型内部某层的激活向量 x,编码器映射成更高维但更稀疏的特征向量,再由解码器拼回原表示。关键不是“维度更大”,而是激活更少、更分散、更可读
图2:Qwen3模型一个transformer块内的三种SAE训练位置示意图。
论文把 SAE 安在 transformer 块里的三个关键出口上,以比较不同位置的可解释性。
训练上主打 JumpReLU SAE,它多了一个阈值“跳门”:只有当预激活超过阈值才被放出。每个 latent 有自己的门槛,激活数量自适应变化。训练目标由重构损失和 L0 稀疏约束构成,由于 L0 惩罚和阈值参数的梯度不好直接算,采用了基于 STE(直通估计器) 的优化策略。
训练数据用 FineWeb-Edu 教育类文本子集,语言规整、概念集中。硬件用了 14 张 NVIDIA H20-3e GPU。整套流程压缩成一句话:先选层、再编码、再稀疏约束、再重构、最后拿特征去解释和干预

数据准备及实验设计

评测集与训练集同分布,保留约 1B tokens,上下文长度 1024。实验主要看两个维度:FVE(解释多少激活方差)和 DLL(替换激活后模型性能掉了多少)。前者看“字典像不像原件”,后者看“业务还能不能跑”。
表5:评测数据集统计信息。
表5:评测数据集统计。评测集和训练集同源,能更干净地检验 SAE 的重构能力。
图7:Qwen3-4B SAE的评测结果,左图为FVE,右图为DLL。
图7:Qwen3-4B 的评测结果,说明同一套 SAE 方案在小模型和大模型上都管用。

实验结果分析

整体结论:Qwen3-Instruct SAE 在多个层和位置上保持不错的重构能力。残差流和 MLP 位置通常比注意力输出更容易恢复模型性能,这和它们更直接承载语义信息的直觉对得上。
图3:Qwen3-1.7B在不同位置、不同稀疏度和字典大小下的层级DLL。
图3 展示 DLL,不同层的恢复能力呈“先强、再弱、后又变强”的波动。论文解释:早期层特征简单易拆,中间层特征混合更强,后期层表示趋于稳定。
这类层间差异说明“把所有层一锅端”不是最优思路,不同深度的表示有不同分工。
图4:Qwen3-1.7B在不同位置、不同稀疏度和字典大小下的层级FVE。
图4 看 FVE,各种位置的 SAE 都能解释相当一部分方差,说明字典学到的不是空气。注意 FVE 高不代表 DLL 一定好,模型最终关心的是任务行为。
论文还观察到:字典越大不一定越稳。在注意力输出上,65k 字典有时比 16k 更不稳定,原因可能是特征被切得太碎,出现特征分裂和吸收。
图5:固定字典大小下,目标L0与平均FVE、DLL的关系。
图5 说明 L0 对 FVE 影响有限,但对 DLL 影响更明显:更大的 L0 往往带来更好的性能恢复
整体来看,实验把 activation-level 和 model-level 两层指标都摆出来,避免了“字典看起来很美,模型一跑就翻车”。

实验结果

论文最“能打”的地方是拒答干预。作者先找出与拒答行为相关的 SAE 特征,再沿解码方向加回残差流,看模型是否更爱说“不”。这一步把“解释”往“控制”推进了一格。
表1:模型、SAE特征ID与目标干预层。
表1:用于拒答干预的特征与层位,说明干预不是拍脑袋选层,而是先做特征定位。
图6:用于搜索拒答相关SAE特征的提示词。
图6:搜索拒答特征时使用的提示词,思路是构造拒答样本,看哪些 SAE 特征在拒答 token 上高频出现且激活较强。
拒答评估用 WildGuard、XSTest 和混合集,通过预定义拒答指示词(如“I’m sorry”)计算 refusal_score。
图8:用于计算refusal_score的预定义拒答指示词集合。
图8:拒答指示词集合,定义朴素但可执行、可复现。
结果:随机特征干预几乎把拒答行为搞崩了,而目标特征干预在 unsafe 样本上显著提高拒答率,说明找到“对的那根筋”后,模型行为可以被定向推动。
图9:Qwen3-1.7B的SAE特征激活热力图。
图9:特征激活热力图,把“某个特征在什么时候亮起来”直接摊在眼前。
图10:不同模型和数据集上,拒答率随干预系数α变化的关系。
图10:干预系数 α 的影响,说明干预存在合适区间,太弱没效果,太强可能过头。
从实验结果看,论文最重要的不是“拒答率涨了多少”,而是证明了一个方法论:SAE 学到的特征不只是解释工具,还可以成为控制旋钮

总结与未来展望

这篇工作给 Qwen3 的内部表示建立了一套可复用、可评测、可干预的特征字典。论文也承认了限制:8B 模型只放出了部分残差流层,评估集中在重构和拒答干预,离“自动给每个特征起名字”还有距离。未来如果能把自动标注、因果电路发现接上,这类 SAE 资源的价值会更高。🤚
插图

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?它主要解决大模型内部表示难以解释、难以定位特征、难以做行为干预的问题。论文用 SAE 把 Qwen3 的激活拆成稀疏特征字典,再通过重构和拒答干预说明这些特征是可用的。

DLL 和 FVE 分别是什么意思?DLL 是 Delta LM loss,表示把 SAE 重构激活替换回模型后,语言模型损失增加了多少;FVE 是 Fraction of Variance Explained,表示 SAE 在激活层面解释了多少方差。一个看任务性能,一个看表示重构。

JumpReLU SAE 为什么重要?因为它通过阈值跳变和 L0 稀疏约束,让特征激活更自然地变少,从而更容易得到可解释的特征字典。论文也借此展示了稀疏度、保真度和性能恢复之间的权衡关系。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 核心创新在于把 SAE 做成面向 Qwen3 的大规模、可评测、可干预资源库,并把拒答行为的因果干预串了进去。

实验合理度:★★★★☆ 训练、评测、干预三段式设计扎实,DLL 和 FVE 互补合理;不足是 8B 系统性评测还不完整。

学术研究价值:★★★★★ 对机械可解释性和行为控制研究很有价值,把“特征字典”做成公共基础设施。

稳定性:★★★☆☆ 重构指标整体稳定,但不同层、位置、字典大小之间差异明显。

适应性以及泛化能力:★★★☆☆ 在 Qwen3-1.7B 和 4B 上表现不错,对更大模型和更多行为类型的泛化需进一步验证。

硬件需求及成本:★★☆☆☆ 14 张 H20-3e GPU 训练成本偏高,好在结果开源能省后续重复劳动。

复现难度:★★★☆☆ 方法清晰,但大规模 SAE 训练对算力、数据和工程细节要求不低。

产品化成熟度:★★★☆☆ 作为解释和分析工具较成熟;作为在线可控干预方案,需更全面的安全性验证。

可能的问题:论文没把 8B 做全,也没把“特征可解释”自动化到位;更像高质量研究底座,而非最终版答案。


主要参考文献

Yang He, Wei Wang, Bing Zhao, Xuan Ren, WenBo Li, WeiXu Qiao, Hu Wei, Lin Qu. Discovering Millions of Interpretable Features with Sparse Autoencoders. arXiv:2606.26620v1, 2026.
Robert Huben et al. Sparse autoencoders find highly interpretable features in language models.
Leo Gao et al. Scaling and evaluating sparse autoencoders.
He et al. Llama Scope: Extracting millions of features from Llama-3.1-8B with sparse autoencoders.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。AI前沿论文、开源代码、招聘招博、趋势总结,统统安排上。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。