← 返回 PaperDaily
大模型与智能体
阿里开源百万级SAE:Qwen3黑箱被拆开了?
这篇论文最有意思的地方,不是“又训练了一个SAE”,而是把Qwen3的内部表示拆成了能看、能评、还能直接干预的特征字典。更妙的是,它不只讲“重构得像不像”,还真的拿拒答行为做了因果干预,实用味很足。
龙哥读论文
发布于 2026-08-14 09:10:46
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,不是“又训练了一个SAE”,而是把Qwen3的内部表示拆成了能看、能评、还能直接干预的特征字典。更妙的是,它不只讲“重构得像不像”,还真的拿拒答行为做了因果干预,实用味很足。
原论文信息如下:
大模型内部的黑箱如何打开?用稀疏自编码器“翻译”神经元活动,秒级定位拒绝行为,从Qwen3中提取百万级可解释特征,揭秘深度模型的“思维”模式
大模型最让人上头的地方,不是它会写诗、会答题,而是它明明很会,却又说不清自己到底怎么会的 。这就像一个学霸,卷子永远满分,但你问他解题步骤,他只回一句“感觉”。
这篇论文做的事,正是给 Qwen3 的内部表示装了一本“翻译词典”。它用稀疏自编码器 把原本混在一起的神经元活动拆成一个个更容易理解的特征,还进一步证明:这些特征不只是“看起来像”,甚至还能被拿来因果干预模型行为 ,比如把模型往“拒答”方向推一把。
问题背景及相关工作
大模型内部并不是“一个神经元管一个概念”,更常见的是superposition(叠加) 现象:一个方向里塞了好几个概念。为了拆开这种“混搭表示”,研究者提出了Sparse Autoencoder(SAE) ,学一个更大的“字典”,把每个输入拆成少量激活的特征再重构原表示。相关工作如 Gemma Scope、LlamaScope 已证明,把 SAE 做成公共资源对机械可解释性研究很有价值。本文的贡献,就是把这套方法推进到 Qwen3 指令模型家族上。
术语解读
Residual stream 残差流:transformer 层间传递信息的“主干道”。
MLP outputs 多层感知机输出:存储和变换语义信息的重要位置。
Attention outputs 注意力输出:负责把别的 token 的信息“拉过来”加工。
JumpReLU 带阈值跳变的稀疏激活函数,让特征在阈值上方才“跳出来”。
DLL Delta LM loss,语言模型损失变化量,衡量替换激活后模型性能掉了多少。
FVE Fraction of Variance Explained,解释方差比例,衡量 SAE 还原原表示的程度。
论文主体思路
*表格超出部分左右可以滑动
项目
内容
应用场景 解释 Qwen3 指令模型内部表示,定位可解释特征,探索安全行为干预。
问题建模 将模型激活表示视为可被稀疏字典分解的高维向量,用 SAE 学习“少量特征重构原表示”。
模型 Backbone 及选择原因 Qwen3-1.7B、Qwen3-4B、Qwen3-8B 指令模型;选择 Qwen3 是因为其指令能力强,适合观察对齐与拒答行为。
损失函数 重构损失 + 稀疏正则;JumpReLU 版本进一步用 L0 约束控制激活特征数。
训练数据集 FineWeb-Edu 子集 Sample-10BT 的教育类文本。
测试数据集 同分布评测集,保留约 1B tokens,评测上下文长度 1024。
训练方法 在残差流、MLP 输出、注意力输出三个位置训练层级 SAE;1.7B 和 4B 覆盖全层,8B 先放出部分残差流层。
实验效果 重构和性能恢复整体表现稳定;残差流与 MLP 通常优于注意力输出,且拒答干预能明显提升目标行为。
方法优势 特征可解释、可评估、可干预,且提供了大规模公开字典资源。
方法缺点 训练成本高;对 8B 只做了部分层;可解释性仍需人工与自动化结合验证。
这张表把论文主线一口气看明白:先训练字典,再评估重构,再拿特征做干预 。
核心设计
SAE 的基本工作方式:输入模型内部某层的激活向量 x ,编码器映射成更高维但更稀疏的特征向量,再由解码器拼回原表示。关键不是“维度更大”,而是激活更少、更分散、更可读 。
训练上主打 JumpReLU SAE ,它多了一个阈值“跳门”:只有当预激活超过阈值才被放出。每个 latent 有自己的门槛,激活数量自适应变化。训练目标由重构损失和 L0 稀疏约束构成,由于 L0 惩罚和阈值参数的梯度不好直接算,采用了基于 STE(直通估计器) 的优化策略。
训练数据用 FineWeb-Edu 教育类文本子集,语言规整、概念集中。硬件用了 14 张 NVIDIA H20-3e GPU。整套流程压缩成一句话:先选层、再编码、再稀疏约束、再重构、最后拿特征去解释和干预 。
数据准备及实验设计
评测集与训练集同分布,保留约 1B tokens ,上下文长度 1024 。实验主要看两个维度:FVE (解释多少激活方差)和 DLL (替换激活后模型性能掉了多少)。前者看“字典像不像原件”,后者看“业务还能不能跑”。
实验结果分析
整体结论:Qwen3-Instruct SAE 在多个层和位置上保持不错的重构能力。残差流和 MLP 位置通常比注意力输出更容易恢复模型性能,这和它们更直接承载语义信息的直觉对得上。
这类层间差异说明“把所有层一锅端”不是最优思路,不同深度的表示有不同分工。
论文还观察到:字典越大不一定越稳 。在注意力输出上,65k 字典有时比 16k 更不稳定,原因可能是特征被切得太碎,出现特征分裂和吸收。
整体来看,实验把 activation-level 和 model-level 两层指标都摆出来,避免了“字典看起来很美,模型一跑就翻车”。
实验结果
论文最“能打”的地方是拒答干预。作者先找出与拒答行为相关的 SAE 特征,再沿解码方向加回残差流,看模型是否更爱说“不”。这一步把“解释”往“控制”推进了一格。
拒答评估用 WildGuard、XSTest 和混合集,通过预定义拒答指示词(如“I’m sorry”)计算 refusal_score。
结果:随机特征干预几乎把拒答行为搞崩了 ,而目标特征干预在 unsafe 样本上显著提高拒答率,说明找到“对的那根筋”后,模型行为可以被定向推动。
从实验结果看,论文最重要的不是“拒答率涨了多少”,而是证明了一个方法论:SAE 学到的特征不只是解释工具,还可以成为控制旋钮 。
总结与未来展望
这篇工作给 Qwen3 的内部表示建立了一套可复用、可评测、可干预的特征字典。论文也承认了限制:8B 模型只放出了部分残差流层,评估集中在重构和拒答干预,离“自动给每个特征起名字”还有距离。未来如果能把自动标注、因果电路发现接上,这类 SAE 资源的价值会更高。🤚
龙迷三问
这篇论文解决什么问题? 它主要解决大模型内部表示难以解释、难以定位特征、难以做行为干预的问题。论文用 SAE 把 Qwen3 的激活拆成稀疏特征字典,再通过重构和拒答干预说明这些特征是可用的。
DLL 和 FVE 分别是什么意思? DLL 是 Delta LM loss,表示把 SAE 重构激活替换回模型后,语言模型损失增加了多少;FVE 是 Fraction of Variance Explained,表示 SAE 在激活层面解释了多少方差。一个看任务性能,一个看表示重构。
JumpReLU SAE 为什么重要? 因为它通过阈值跳变和 L0 稀疏约束,让特征激活更自然地变少,从而更容易得到可解释的特征字典。论文也借此展示了稀疏度、保真度和性能恢复之间的权衡关系。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 核心创新在于把 SAE 做成面向 Qwen3 的大规模、可评测、可干预资源库,并把拒答行为的因果干预串了进去。
实验合理度: ★★★★☆ 训练、评测、干预三段式设计扎实,DLL 和 FVE 互补合理;不足是 8B 系统性评测还不完整。
学术研究价值: ★★★★★ 对机械可解释性和行为控制研究很有价值,把“特征字典”做成公共基础设施。
稳定性: ★★★☆☆ 重构指标整体稳定,但不同层、位置、字典大小之间差异明显。
适应性以及泛化能力: ★★★☆☆ 在 Qwen3-1.7B 和 4B 上表现不错,对更大模型和更多行为类型的泛化需进一步验证。
硬件需求及成本: ★★☆☆☆ 14 张 H20-3e GPU 训练成本偏高,好在结果开源能省后续重复劳动。
复现难度: ★★★☆☆ 方法清晰,但大规模 SAE 训练对算力、数据和工程细节要求不低。
产品化成熟度: ★★★☆☆ 作为解释和分析工具较成熟;作为在线可控干预方案,需更全面的安全性验证。
可能的问题: 论文没把 8B 做全,也没把“特征可解释”自动化到位;更像高质量研究底座,而非最终版答案。
主要参考文献
Yang He, Wei Wang, Bing Zhao, Xuan Ren, WenBo Li, WeiXu Qiao, Hu Wei, Lin Qu. Discovering Millions of Interpretable Features with Sparse Autoencoders. arXiv:2606.26620v1, 2026.
Robert Huben et al. Sparse autoencoders find highly interpretable features in language models.
Leo Gao et al. Scaling and evaluating sparse autoencoders.
He et al. Llama Scope: Extracting millions of features from Llama-3.1-8B with sparse autoencoders.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
AI前沿论文、开源代码、招聘招博、趋势总结,统统安排上。