← 返回 PaperDaily 大模型与智能体

叠加降低的真相:非鲁棒特征被精准丢弃,Ilyas理论在玩具模型中实锤

对抗训练能降低神经网络的叠加表示,这早已被实验观察到,但“为什么”一直缺个说法。这篇独立研究用玩具模型把因果链拆得明明白白:对抗训练就是干脆利落地丢掉非鲁棒特征。逻辑闭环、干净利落,值得一读。

叠加降低的真相:非鲁棒特征被精准丢弃,Ilyas理论在玩具模型中实锤
原论文信息如下:
论文标题:
为什么对抗训练会减少叠加?(Why Does Robustness Reduce Superposition?)
发表日期:
2026年08月

发表单位:
独立研究员(Independent Researcher)

原文链接:
https://arxiv.org/pdf/2608.22155v1.pdf
先问大伙儿一个问题:一个模型想变得更鲁棒,第一步该干什么?很多人第一反应是“多学点稳健的特征”“把模型练得更皮实”。但这篇论文给出的答案有点反直觉——对抗训练的第一步,居然是“断舍离”,主动扔掉一批特征。就好比整理房间,为了不让杂物干扰你走路,干脆把一抽屉东西全扔了,房间顿时清爽了,也不容易被绊倒了。

引言

对抗样本这玩意儿,从2015年Goodfellow等人第一次发现“给图片加一点点肉眼看不见的噪声,就能让模型认错东西”开始,就成了深度学习头上的一朵乌云。十多年过去了,大家还在争论它到底从哪来。2019年,Ilyas等人给出了一个很有影响力的解释:模型之所以会被骗,是因为它依赖了一类“非鲁棒特征”——这些特征在干净数据上很管用,预测能力很强,但只要输入被稍微扰动一下,它们就完全失灵。这个解释解决了“为什么会被骗”的问题,但留下了另一个关键问题:这些特征在模型内部到底是怎么表示的?
2025年,Gorton和Lewis往前迈了一步,把对抗样本和“叠加”这个概念联系了起来。所谓叠加,就是模型用比特征数量更少的维度来编码特征,多个特征挤在同一个维度空间里。他们的实验表明:对抗样本利用的正是这种叠加表示,而且对抗训练确实能降低叠加程度。但问题来了——为什么对抗训练会减少叠加?这个“为什么”他们没给出机制层面的解释。
今天要聊的这篇论文,就是来填这个坑的。作者用和Gorton & Lewis一样的玩具模型,把因果链完整地捋了一遍:对抗训练放弃了非鲁棒特征 → 需要表示的特征总数变少 → 叠加自然减少。三个步骤,环环相扣。而且作者不只是说说,他构造了一个“事先就知道哪些特征鲁棒、哪些不鲁棒”的合成数据集,直接把模型的丢弃行为跟预设的标签对上了——精确到每一个特征索引,一个不差。
这篇文章的思路,说白了就是用Ilyas的特征分类学,去解释Gorton的叠加现象,再把两者之间的逻辑缺口焊上。虽然用的是玩具模型,但逻辑相当完整,读完会有一种“哦,原来如此”的爽快感。下面咱们一层层拆开看。

问题背景及相关工作


叠加:把多个特征挤进同一个空间

“叠加”这个概念来自Elhage等人2022年的经典工作《Toy Models of Superposition》。说人话就是:模型的隐藏层明明只有n个神经元,却要表示m个特征(m远大于n),于是多个特征就被压缩、重叠地编码在同一个表示空间里。就好比一个20平的公寓硬塞了100个人,大家只能叠着睡。
叠加的程度跟数据的稀疏度密切相关。在Elhage的玩具模型里,输入x的每个分量以概率1-S被激活,S越大,数据越稀疏。稀疏度越高,模型越有动力用同一个维度去表示多个特征,因为你不能指望每个特征都频繁出现,专们为每个特征准备一个维度太浪费了。

干扰:特征之间的“互相踩脚”

特征挤在一起,就免不了互相干扰。Elhage把干扰定义为特征方向之间的非正交程度:如果两个特征方向的内积为0,它们就是正交的,互不干扰;内积不为0,就存在干扰。内积越正,一个特征的激活就越容易错误地触发另一个特征的重建,这种干扰是有害的。最理想的情况是内积为-1,也就是两个特征方向完全相反(反平行),这样当其中一个激活时,另一个反而被抑制,干扰最小化。
对抗训练为何减少叠加?一个因果链解释
对抗训练能降低神经网络的叠加程度,这已经被Gorton和Lewis在2025年的工作中实证观察到了。但他们留下了一个关键问题没有回答:为什么?为什么对抗训练会改变模型对特征数量的选择?
这篇论文给出了一个干净利落的因果链:对抗训练放弃了非鲁棒特征 → 需要编码的特征总数变少 → 叠加自然减少。三个环节环环相扣,逻辑闭环刚刚好。
具体来说,论文的主要贡献有三点。第一,在多个稀疏度水平下,对抗训练模型都比标准训练模型丢弃了更多的特征。第二,被丢弃的特征携带更高的平均干扰,而保留特征的干扰值集中在−1附近——这是反平行排列,也就是最小化交叉干扰的几何配置。第三,通过构造一个鲁棒/非鲁棒特征身份事先已知的合成数据集,论文直接验证了被丢弃的特征就是非鲁棒特征,精确到一个索引都不差。
用大白话讲,对抗训练就像整理衣橱。把那些容易起球、变形、穿一次就废的衣服全扔了,剩下的都是经穿百搭的基础款,衣橱自然整齐,也省空间。叠加程度下降并不是模型学会了什么新技能,而是它“扔东西”扔得足够果断😏。

从特征分类到内部表示:连接Ilyas与Gorton的桥梁

要理解这篇论文的位置,得先把两个理论框架摆清楚。
第一个是Ilyas等人在2019年提出的特征分类理论。那篇论文的标题就很直白:“对抗样本不是bug,而是特征”(Adversarial Examples Are Not Bugs, They Are Features)。核心观点是:模型之所以会被对抗样本欺骗,不是模型有漏洞,而是因为它依赖了一类在干净数据上预测能力很强、但对微小扰动却极敏感的特征——非鲁棒特征。与之相对,鲁棒特征是指那些在扰动下依然稳定的高信号模式。Ilyas的理论解释了对抗样本从哪里来,但没有回答:这些特征在模型内部到底是怎么表示的?
第二个是Gorton和Lewis在2025年的工作。他们把对抗样本与叠加现象连接起来,证明对抗样本利用的正是神经网络的叠加表示——多个特征被压缩在远低于特征数量的维度空间里——同时实验发现对抗训练能够降低叠加。但他们同样留下了一个问题:为什么?
这里补一下基础概念。叠加(Superposition)这个术语来自Elhage等人2022年的论文《Toy Models of Superposition》,描述的是模型用n个维度表示m个特征(m远大于n)时,多个特征共用一个维度空间的现象。干扰(Interference)则是叠加的伴生问题:因为特征方向通常不是完全正交的,一个特征的激活可能会错误地触发另一个特征的重建。两个特征方向的内积越正,这种干扰越严重;当内积为−1、即反平行排列时,一个特征激活会抑制另一个特征,干扰反而最小。
这篇论文干的事,就是在这两个框架之间搭一座桥:用Ilyas的特征分类学去解释Gorton观察到的叠加减少现象。逻辑很直接——对抗训练模型叠加少,不是因为它重新安排了特征的编码方式,而是因为它主动放弃了非鲁棒特征。特征总数变少了,自然不需要在有限维度里挤得那么厉害。
还需要解释一个关键概念:稀疏度。在玩具模型中,稀疏度S控制输入x每个分量的激活概率:每个分量以概率1−S被保留,否则置零。S越大,数据越稀疏,模型越有动力让多个特征共享维度,叠加就越严重。论文特意把稀疏度扫描范围选在S = {0.78, 0.80, 0.88, 0.90},避开了两个极端——太低的稀疏度让叠加没有意义,太高的稀疏度让所有特征都能被无干扰地表示。

实验设计:玩具模型与结构化数据的双重验证

实验设计分两层:先在标准玩具模型上确认现象,再用结构化数据验证因果。

第一层:标准玩具模型

模型结构沿用了Elhage等人的经典设置。权重矩阵W ∈ R^{20×100},输入x ∈ R^{100},隐藏表示h = Wx ∈ R^{20},通过ReLU(W^T h + b)重建输入,优化目标是最小化均方误差。100个特征挤进20个维度,这是观察叠加的理想条件。
为了量化叠加,论文引入了两个指标。叠加度量Φ和表示能力P分别定义为:
叠加度量公式
Φ = ||W||²_F / n,表示分布在所有隐藏维度上的总能量,Φ随叠加程度和稀疏度单调增加。
表示能力公式
P = ||W||²_F,表示所有特征方向上的总能量。因为Φ = P/n,在n固定的情况下两者是成正比的——叠加减少和表示能力下降,其实是同一枚硬币的两面。
判断特征是否被丢弃,用的是特征列范数阈值法:计算每个特征列的L2范数||W_{:,i}||₂,如果低于阈值τ = 0.01就算被丢弃。干扰矩阵则通过Gram矩阵G = WW^T对角线置零得到,每行求和就是该特征的总干扰。
对抗训练协议沿用了Madry等人(2019)的框架:把干净损失和对抗损失的加权和作为训练目标,权重α = 0.5,对抗样本通过单步L2梯度攻击生成,扰动半径按批次内样本的平均L2范数比例设置,生成前加少量噪声以避免梯度掩蔽。模型训练150,000步,学习率10⁻³。对抗样本的生成方式和对抗训练的总损失为:
对抗样本生成公式
对抗样本的生成:在L2范数约束下,沿着梯度方向寻找使损失最大化的扰动。
对抗训练损失公式
对抗训练的总损失:干净样本损失和对抗样本损失的加权和,α = 0.5用来平衡干净精度和鲁棒精度,防止某一方崩溃。

第二层:结构化数据

标准玩具模型有一个关键局限:只能事后观察模型丢了哪些特征,却没有事先的“标准答案”。为此,作者构造了一个鲁棒和非鲁棒特征身份事先已知的数据集——随机选择30个特征作为鲁棒集合R,剩下的70个作为非鲁棒集合N,然后按幅度缩放:鲁棒特征乘以6.0,非鲁棒特征乘以0.2。高幅度对应高信号、稳定、抗扰动;低幅度则容易被扰动摧毁。这个先验划分,就是验证模型行为的基准答案(ground truth)。同时让非鲁棒特征数量大于鲁棒特征(70 > 30),对应了Li & Li(2025)的结论:非鲁棒特征在特征空间中更密集。

核心发现:非鲁棒特征被精确丢弃

先看第一组结果。在稀疏度S从0.78到0.90的范围内,对抗训练模型的叠加度量Φ始终低于标准训练模型,差距随稀疏度增加而拉大——这是对Gorton & Lewis结果的成功复现。同时,表示能力P也同步下降,说明模型不是重新安排了特征的编码方式,而是总容量本身减少了。
图1a
图1(a):两种训练机制下叠加度量Φ随S的变化。对抗训练一致地降低叠加程度,在设定的稀疏度范围内复现了Gorton & Lewis(2025)的发现。
图1b
图1(b):表示能力P随S的变化。对抗训练模型一致表现出更低的表示能力,且差距随稀疏度增加而扩大。图1整体说明:对抗训练丢弃特征时,叠加程度和表示能力同步下降。
再看特征丢弃行为。应用特征表示阈值后,对抗训练模型在每一个稀疏度水平下丢弃的特征数都更多。更关键的是干扰几何:被丢弃特征的平均干扰要么为正,要么虽然是负但比保留特征更接近0;而保留特征的平均干扰集中接近−1——反平行排列,这是最小化干扰的理想几何。
图2a
图2(a):对抗训练和标准训练在每个稀疏度水平下丢弃的特征数量。对抗训练模型在每个稀疏度水平下都丢弃更多特征。
图2b
图2(b):对抗训练模型中保留特征与丢弃特征的平均干扰对比。被丢弃特征一致表现出更高或“不那么负”的平均干扰,也就是说,它们正是几何上代价最高的特征。
结构化数据给出了最惊艳的结果😲。在S的每个取值上,对抗训练模型丢弃的特征数都恰好是70个——不多不少,正好等于非鲁棒集合N的大小。即使在S = 0.88和0.90时,标准训练模型一个特征都不丢,对抗训练模型依然稳定地丢弃70个。这说明丢弃行为和稀疏度无关,就是专门冲着非鲁棒特征去的。
图3左 图3
图3:结构化数据下各稀疏度水平的特征丢弃情况(左)和对抗训练模型保留与丢弃特征的平均干扰(右)。对抗训练模型在每个稀疏度水平都精确丢弃70个特征;被丢弃特征携带正净干扰,保留特征携带负净干扰。
最后的终极验证:把模型丢弃特征的索引和数据集生成时记录的非鲁棒特征索引逐一比对,结果完全重合,一个不差。
图4
图4:ground truth划分与模型丢弃索引在不同稀疏度水平下的对比。每个稀疏度水平下,上图是ground truth,下图是对抗训练模型的输出,完全一致的图案确认了对抗训练精确地瞄准了非鲁棒集合N。
这个结果说明,对抗训练模型的丢弃操作不是“随机扔几个意思一下”,而是把所有非鲁棒特征精确地清出了表示空间。

理论直觉:直接损失膨胀与代价干扰

为什么对抗训练非得丢掉非鲁棒特征不可?论文给了概念性的理论解释,分两个互补机制。
机制一是直接损失膨胀。因为重建损失是按特征逐项求和的,在对抗攻击下,任何一个被翻转的非鲁棒特征都会给损失贡献一个非零惩罚项。输入里被翻转的非鲁棒特征越多,损失就越高。如果把这些特征全部丢掉,惩罚项就清零,对抗损失就能自由地降到最低。用公式表示就是:损失的递增链——翻转的特征从0个到|N|个,损失严格递增。
损失递增链公式
损失随被翻转的非鲁棒特征数量k严格递增。k = 0时损失最小,k = |N|时损失最大。
机制二是代价干扰。非鲁棒特征的特征几何非常差:它们的平均净干扰落在0到2的正区间,意味着一个特征激活会错误触发其他特征的重建,进一步污染重建质量。而保留特征的平均干扰接近−1,反平行排列,一个特征激活时反而抑制其他特征,干扰几乎被抵消。
两个机制叠加,结论很清晰:非鲁棒特征既直接抬高对抗损失,又拥有最差的几何配置,是模型最小化对抗目标时首先要清除的障碍。把它们全部清除,叠加自然降低,鲁棒性同步提升。

局限与展望:从玩具模型到真实世界

论文的逻辑链条很漂亮,但局限也很明显:所有实验都在玩具模型上完成。100个特征、20个维度的自编码器,距离真实世界的图像分类模型还有相当远的距离。真实模型的特征关系要复杂得多,非鲁棒特征的边界也更模糊,不能直接把玩具模型里的结论套到真实模型上。
论文顺带留下了两个开放问题:为什么对抗训练会保留剩余特征的几何结构,干扰值基本不变?为什么对抗训练会促使特征走向反平行排列,形成“反平行叠加”?
后续的研究路径也很清楚:用稀疏自编码器(Sparse Autoencoders,SAEs)这类可解释性工具,在真实模型上检验这一因果链。如果理论在真实模型上成立,意义就不只是解释对抗训练——我们可以主动利用鲁棒/非鲁棒特征的权衡,在降低多义性、提升可解释性的同时保持鲁棒性,那将是从“解释模型”走向“设计模型”的关键一步。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?对抗训练为何降低叠加?本文用玩具模型补上缺失的因果链:对抗训练会丢弃更多特征,且丢弃的恰是Ilyas特征分类学中的非鲁棒特征。结构化数据下,模型在每个稀疏度都精确丢弃70个非鲁棒特征,与预设集合完全一致。
这篇工作最值得看的点是什么?对抗训练模型在所有稀疏度水平下均比标准训练模型丢弃更多特征;在结构化数据下,对抗训练模型精确丢弃全部70个非鲁棒特征,且该行为与稀疏度无关
这篇工作的边界或风险在哪里?优点:建立了清晰的因果链解释对抗训练减少叠加的机制;使用合成数据直接验证了非鲁棒特征与丢弃特征的对应关系;实验设计简洁有效。缺点:仅使用玩具模型,缺乏真实世界模型验证;理论解释为概念性而非形式化推导;未探讨对抗训练保留特征几何结构的机制
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

用Ilyas的特征分类学补上了Gorton & Lewis叠加减少现象缺失的机制环节,思路巧妙,逻辑闭环干净。

实验合理度:★★★★☆

双重验证设计很扎实,结构化数据带ground truth,让结论非常可靠;但只用了玩具模型,缺真实模型佐证。

学术研究价值:★★★★☆

连接了两个有影响力的理论框架,为对抗鲁棒性和可解释性的交叉研究提供了一个新视角。

稳定性:★★★☆☆

在设定的稀疏度范围内结果可重复;范围之外和更复杂场景中的行为未知。

适应性以及泛化能力:★★☆☆☆

目前仅在玩具自编码器和重建任务上验证,迁移到分类任务和真实模型需要更多工作。

硬件需求及成本:★★★★★

玩具模型训练150,000步仅需单块普通GPU,计算成本极低,这是这类研究最大的落地优势。

复现难度:★★★★☆

论文给出了完整的公式、超参数设置和数据生成伪代码,实现门槛低;没有官方代码仓库算是一个扣分项。

产品化成熟度:★★☆☆☆

纯理论研究,距离产品应用还很远,价值主要在学术启发而非工程落地上。

可能的问题:玩具模型结论外推需谨慎;理论论证是概念性解释而非严格数学推导;非鲁棒特征在重建任务与分类任务间的定义适配性讨论不足。


主要参考文献

[1] Gorton, L., & Lewis, O. (2025). Adversarial examples are not bugs, they are superposition. arXiv preprint arXiv:2508.17456.
[2] Ilyas, A., Santurkar, S., Tsipras, D., Engstrom, L., Tran, B., & Madry, A. (2019). Adversarial examples are not bugs, they are features. In Advances in Neural Information Processing Systems, volume 32.
[3] Elhage, N., Hume, T., Olsson, C., et al. (2022). Toy models of superposition. arXiv preprint arXiv:2209.10652.
[4] Goodfellow, I. J., Shlens, J., & Szegedy, C. (2015). Explaining and harnessing adversarial examples. In International Conference on Learning Representations (ICLR).
[5] Madry, A., Makelov, A., Schmidt, L., Tsipras, D., & Vladu, A. (2019). Towards deep learning models resistant to adversarial attacks. In International Conference on Learning Representations (ICLR).
[6] Li, B., & Li, Y. (2025). Adversarial training can provably improve robustness: Theoretical analysis of feature learning process under structured data. arXiv preprint arXiv:2410.08503.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
对抗训练都在做“断舍离”,你的知识储备也该减减负啦!😏 想搞懂叠加、非鲁棒特征和可解释性最新进展?加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 可解释性+北京+中科院+小龙),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。