“叠加”这个概念来自Elhage等人2022年的经典工作《Toy Models of Superposition》。说人话就是:模型的隐藏层明明只有n个神经元,却要表示m个特征(m远大于n),于是多个特征就被压缩、重叠地编码在同一个表示空间里。就好比一个20平的公寓硬塞了100个人,大家只能叠着睡。叠加的程度跟数据的稀疏度密切相关。在Elhage的玩具模型里,输入x的每个分量以概率1-S被激活,S越大,数据越稀疏。稀疏度越高,模型越有动力用同一个维度去表示多个特征,因为你不能指望每个特征都频繁出现,专们为每个特征准备一个维度太浪费了。
要理解这篇论文的位置,得先把两个理论框架摆清楚。第一个是Ilyas等人在2019年提出的特征分类理论。那篇论文的标题就很直白:“对抗样本不是bug,而是特征”(Adversarial Examples Are Not Bugs, They Are Features)。核心观点是:模型之所以会被对抗样本欺骗,不是模型有漏洞,而是因为它依赖了一类在干净数据上预测能力很强、但对微小扰动却极敏感的特征——非鲁棒特征。与之相对,鲁棒特征是指那些在扰动下依然稳定的高信号模式。Ilyas的理论解释了对抗样本从哪里来,但没有回答:这些特征在模型内部到底是怎么表示的?第二个是Gorton和Lewis在2025年的工作。他们把对抗样本与叠加现象连接起来,证明对抗样本利用的正是神经网络的叠加表示——多个特征被压缩在远低于特征数量的维度空间里——同时实验发现对抗训练能够降低叠加。但他们同样留下了一个问题:为什么?这里补一下基础概念。叠加(Superposition)这个术语来自Elhage等人2022年的论文《Toy Models of Superposition》,描述的是模型用n个维度表示m个特征(m远大于n)时,多个特征共用一个维度空间的现象。干扰(Interference)则是叠加的伴生问题:因为特征方向通常不是完全正交的,一个特征的激活可能会错误地触发另一个特征的重建。两个特征方向的内积越正,这种干扰越严重;当内积为−1、即反平行排列时,一个特征激活会抑制另一个特征,干扰反而最小。这篇论文干的事,就是在这两个框架之间搭一座桥:用Ilyas的特征分类学去解释Gorton观察到的叠加减少现象。逻辑很直接——对抗训练模型叠加少,不是因为它重新安排了特征的编码方式,而是因为它主动放弃了非鲁棒特征。特征总数变少了,自然不需要在有限维度里挤得那么厉害。还需要解释一个关键概念:稀疏度。在玩具模型中,稀疏度S控制输入x每个分量的激活概率:每个分量以概率1−S被保留,否则置零。S越大,数据越稀疏,模型越有动力让多个特征共享维度,叠加就越严重。论文特意把稀疏度扫描范围选在S = {0.78, 0.80, 0.88, 0.90},避开了两个极端——太低的稀疏度让叠加没有意义,太高的稀疏度让所有特征都能被无干扰地表示。
[1] Gorton, L., & Lewis, O. (2025). Adversarial examples are not bugs, they are superposition. arXiv preprint arXiv:2508.17456.[2] Ilyas, A., Santurkar, S., Tsipras, D., Engstrom, L., Tran, B., & Madry, A. (2019). Adversarial examples are not bugs, they are features. In Advances in Neural Information Processing Systems, volume 32.[3] Elhage, N., Hume, T., Olsson, C., et al. (2022). Toy models of superposition. arXiv preprint arXiv:2209.10652.[4] Goodfellow, I. J., Shlens, J., & Szegedy, C. (2015). Explaining and harnessing adversarial examples. In International Conference on Learning Representations (ICLR).[5] Madry, A., Makelov, A., Schmidt, L., Tsipras, D., & Vladu, A. (2019). Towards deep learning models resistant to adversarial attacks. In International Conference on Learning Representations (ICLR).[6] Li, B., & Li, Y. (2025). Adversarial training can provably improve robustness: Theoretical analysis of feature learning process under structured data. arXiv preprint arXiv:2410.08503.