论文最有争议、也最有价值的一段,是一个很直接的结论:如果去噪器在训练和采样时都能看到 A,那么 A 的具体分布其实是个 nuisance(干扰项)。更狠一点说,在“精确去噪器”极限下,生成分布根本不依赖这个混合律,甚至对 A 的干预也不会改变结果。这个结论不是抬杠,而是概率论上的严格结果。直白理解就是:如果模型已经明确知道“今天噪声有多大、怎么缩放”,那噪声到底是高斯、重尾、还是别的什么花样,很多时候都只是换了个壳。真正决定最终样本的是去噪器学得准不准,而不是噪声故事讲得多漂亮。这也是为什么论文标题里那句“what the noise mechanism actually controls”很有分量。噪声机制控制的是它能提供什么结构,而不是自动替模型完成结构传递。传不传得过去,取决于去噪器有没有条件信息,以及训练目标有没有把这层关系真正学进去。表2把这件事说得很明白:只要去噪器看见 A,不管 A 的噪声机制是完全独立、共享尺度,还是 DSPM 这种带记忆的链,模型最终对聚集结构的拟合都差不多。也就是说,条件信息把“噪声的戏份”压得很低。作者还做了一个很有杀伤力的干预实验:在采样时把波动率链人为拉高 8 倍。按朴素理解,生成路径的包络应该跟着明显抖起来,甚至接近线性放大;结果却是,条件化模型几乎把这个干预“抹平”了,包络变化远小于预期,甚至方向都不对。这个结果很像在说:你给模型换了一个更吵的麦克风,但它耳朵里装的是降噪芯片。图4就是这个“无效干预”的视觉证据。左图里三种 A 场景几乎叠在一起,右图里即使给了 ×8 的波动率冲击,路径也没有出现对应的爆发。这个现象和定理完全一致:A 在这里更像条件标签,而不是控制旋钮。反过来,如果把去噪器对 A 设为“盲视”,噪声机制反而会被原样传递出来。这个设计有点残酷,但很有效:当模型不知道 A 是什么,它就没法把 A 的结构洗掉,结果噪声的聚集特征就会在生成样本里保留下来。表3里能看到,盲模型的平方收益自相关几乎按理论值走,i.i.d. 版本则直接塌成接近零,说明“有没有记忆”这件事,确实能被噪声机制提供出来。表3相当于把定理拆开验证:条件化模型更像“学结构”,盲模型更像“传机制”。前者对数据分布更友好,后者对噪声结构更忠实。
条件vs盲模型:实验如何精准验证定理与边界?
这部分实验设计其实挺讲究。作者没有搞“换个模型、换个数据、换个训练预算”这种容易把结论搅浑的套路,而是尽量把变量压到最低:同一个去噪器、同一个训练预算、同一个采样流程,只改 A 的分布或者是否把 A 喂给模型。这样一来,实验结果才更像是在回答一个干净的问题:到底是噪声机制在起作用,还是条件信息在起作用?数据集也很典型:先用 GARCH(1,1)-t 生成合成金融路径,再看模型能不能复原其厚尾和聚集特征。这样做的好处是,真实波动率是已知的,能直接检验编码器有没有学到“真正的波动率”,而不是只学到某种表面上的统计代理。说白了,合成数据在这里不是偷懒,而是为了把真相摆在台面上。实验结果的主线可以概括成两句话。第一,条件化模型确实能学到数据里的聚集结构,但这种结构并不需要靠噪声机制本身来“传输”;第二,盲模型会把噪声结构原封不动带出来,但这并不代表它更适合生成高质量金融序列,因为一旦去噪器看不见 A,重尾和聚集也可能一起失控,导致极端统计量爆炸。图3里能看到一个很现实的结论:条件化之后,几个模型在聚集结构上的差距没有想象中那么夸张,说明重尾噪声更多是在提供先验偏置,而不是直接接管生成过程。这里还要注意一个细节:论文没有把“条件化模型没差异”简单解释成“重尾没用”。作者的态度更严谨——重尾噪声在有限步数、有限模型容量、有限优化条件下,可能仍然带来一些 inductive bias(归纳偏置)上的收益,比如尾部覆盖更稳一点;但它并不会像很多人想象的那样,自动成为“结构建模器”。这个区分很重要,不然很容易把统计先验和因果控制混为一谈。
这篇论文到底解决了什么问题?它不是单纯追求“更重尾”的噪声,而是回答了一个更本质的问题:金融扩散模型里的噪声机制,到底是在提供可观测的波动率结构,还是在真正控制生成结果。论文用定理和实验分别证明了两件事:带记忆的波动率链可以精确刻画聚集,但当去噪器已经看到 A 时,这种结构大多不会自动传到生成样本里。
DSPM 里的 A 是什么意思?A 是每个坐标上的随机方差缩放,也可以理解成“波动率时钟”。它不是固定常数,而是一条有记忆的 AR(1) 链,因此相邻时刻的波动率会相关,平方噪声也会出现自相关。这正是它能模拟波动率聚集的原因。
为什么 v1 和 v2 的结论差这么多?因为 v1 里 A 只是外部条件,去噪器看见它以后,很多结构就被“白化”掉了;v2 则把 A 和数据联系起来,让编码器从数据里推断波动率,这样 A 才真正变成控制变量。但代价也很明确:v2 的无条件厚尾和聚集保真度下降了,说明控制和保真目前还没法兼得。
Junchi Shen, Helin Zhao. Denoising Subordinated Probabilistic Models: Diffusion with a Tempered-Stable Volatility Clock, and What the Noise Mechanism Actually Controls. arXiv:2607.19218v1, 2026.Ho et al. Denoising Diffusion Probabilistic Models. 2020.Barndorff-Nielsen and Shephard. Non-Gaussian Ornstein-Uhlenbeck-based models and some of their uses in financial economics. 2001.Carr et al. Time-changed Lévy processes and option pricing. 2003.