引言
这篇工作最有意思的地方,不是“又一个扩散模型”,而是它把量子神经网络直接塞进了时间序列扩散框架里。简单说,就是让量子电路去负责去噪,看看能不能在更少参数下,把金融时间序列的分布学得更像真货。
图3:QDiffusion-TS与经典扩散模型的分布对比。红色是量子模型,蓝色是经典模型,重点看它们和真实金融数据之间的距离谁更小。
方法概述
本方法沿用 Diffusion-TS 的整体思路:先把真实时间序列逐步加噪,最后再一步步去噪生成新样本。不同之处在于,原来 transformer 里负责“中间变换”的前馈网络,被量子神经网络替换了,形成一个混合量子 transformer。说人话就是:经典模型里靠全连接层干活的地方,换成了量子电路来打工。
图1:QDiffusion-TS整体框架与量子神经网络结构。左边展示前向加噪、反向去噪的扩散流程,右边展示量子编码器和解码器里的量子神经网络模块。
模型真正动刀的地方很明确:把 transformer 编码器和解码器中的前馈神经网络全部替换掉。单个模块参数从33088降到36,这不是“优化一点点”,而是直接把参数表砍成了手掌大小。整网参数也从589030降到461254,约减少20%。
实验结果
实验没有只盯着“看起来像不像”,而是分成了分布统计、距离度量和下游预测三层验证。先看统计量,量子模型在均值、方差等中心矩上整体更贴近真实数据,尤其是方差的拟合更稳,这通常意味着生成序列的波动幅度更像真实市场。
图2:生成数据与真实数据中心矩误差对比。这里能看到量子模型在多数特征上的平均绝对误差更低,说明它不只是“会画个大概”,而是连分布细节也更愿意认真抄作业。
图5:下游预测任务中的RMSE和R2表现。把合成数据加进训练集后,预测效果明显变好,RMSE最高可降约71%。这说明生成数据不是摆设,确实能给预测模型补点“见过世面”的经验。
量子硬件实战
最有戏剧性的部分,是它还在 IQM Emerald 量子硬件上跑了推理。通常大家担心的是“硬件噪声会不会把结果搞砸”,但这篇论文给出的结果有点反直觉:硬件版不仅没明显翻车,统计距离还略优于模拟版。量子噪声这次没有当反派,反而像是给生成过程加了点自然扰动。
图6:经典模型、模拟量子模型与硬件量子模型对比。硬件执行结果与模拟结果非常接近,说明这套方法不只是“纸面量子”,而是已经摸到了真实设备的门把手。
龙迷三问
量子模型为什么能少这么多参数?因为量子电路不是简单把经典全连接层换个皮,而是借助量子态空间和纠缠关系,用更紧凑的方式表达特征变换。代价也很现实:编码、测量和硬件约束都不轻松,离“随手就能部署”还有距离。
这类结果能直接说明量子计算已经实用了吗?还不能下这种结论。它证明的是:在特定任务和特定架构里,量子组件可以在参数效率和生成质量上做得不错,但这离“全面替代经典模型”差得还远。
最值得普通从业者关注的点是什么?不是“量子”两个字本身,而是更少参数能否保住甚至提升效果。如果后续能把这种思路迁移到别的生成任务,工程上最先受益的会是对模型体积、推理成本和硬件适配极其敏感的场景。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆。把量子神经网络塞进时间序列扩散模型,这个组合不算常规,但不是为了拼概念,方向是成立的。
实验合理度:★★★★☆。既看分布拟合,也看下游预测,还上了真实量子硬件,链条比较完整。
学术研究价值:★★★★☆。它回答了一个很现实的问题:量子组件能不能在生成任务里换来更高参数效率。
稳定性:★★★☆☆。模拟和硬件结果都不错,但硬件实验规模仍偏小,离大规模验证还有距离。
适应性以及泛化能力:★★★☆☆。目前只在金融时间序列上验证,跨领域泛化还没被证明。
硬件需求及成本:★★★☆☆。参数省了,但量子编码、测量和硬件访问成本并不低,别把“少参数”误读成“低成本万能钥匙”。
复现难度:★★★★☆。经典部分可复现,量子硬件部分门槛明显更高。
产品化成熟度:★★★☆☆。更像面向未来的混合架构探索,离工业级流水线还有一段路。
可能的问题:量子优势目前更多体现在特定结构和特定任务上,是否能稳定推广到更复杂的真实业务,还需要更大规模、更严格的对照实验。
Ho, J., Jain, A. N. & Abbeel, P. Denoising diffusion probabilistic models. Advances in Neural Information Processing Systems 33 (2020).
Yuan, X. & Qiao, Y. Diffusion-TS: Interpretable diffusion for general time series generation (2024). Paper presented at The Twelfth International Conference on Learning Representations (ICLR 2024), Messe Wien Exhibition and Congress Center, Vienna, 7–11 May 2024. Preprint at https://arxiv.org/abs/2403.01742.
Benedetti, M., Lloyd, E., Sack, S. & Fiorentini, M. Parameterized quantum circuits as machine learning models. Quantum Science and Technology 4 (2019).
Mitarai, K., Negoro, M., Kitagawa, M. & Fujii, K. Quantum circuit learning. Phys. Rev. A 98, 032309 (2018).
Schuld, M., Bocharov, A., Svore, K. M. & Wiebe, N. Circuit-centric quantum classifiers. Phys. Rev. A 102, 032308 (2020).
Vaswani, A. et al. Attention is all you need. Advances in Neural Information Processing Systems 30 (2017).
量子+扩散模型:融合创新的新尝试
这篇论文最抓人的地方,不是“量子”三个字本身,而是它盯上了一个很现实的问题:生成模型越来越强,但参数也越来越大,训练和部署成本跟着一起膨胀。金融时间序列这种任务又偏偏很挑剔,既要像真数据,又不能只会“看起来差不多”。于是作者把量子神经网络塞进扩散模型的去噪过程里,试图用更少的参数,学出更像真实市场的分布。
先把背景说人话。扩散模型的套路并不神秘:先把真实数据一点点加噪,加到最后看起来像纯噪声;再训练一个模型反过来一步步去噪,把噪声还原成新样本。它厉害的地方在于,生成过程不是“一步到位瞎猜”,而是像修图一样层层打磨,所以在图像、音频、时间序列里都很能打。
但扩散模型也有老毛病:效果一强,参数就容易跟着膨胀。作者这次借助的是量子机器学习里的量子神经网络,英文全称是 Quantum Neural Network, QNN,中文可理解为“量子神经网络”。它的核心不是把经典网络换个皮肤,而是用参数化量子电路去表示映射关系,利用量子态空间和纠缠结构,尝试在更少参数下表达更复杂的函数。
图1:QDiffusion-TS整体框架与量子神经网络结构。左边是前向加噪、反向去噪的扩散流程,右边是量子编码器和量子解码器里的量子神经网络模块。说白了,就是让量子电路去干扩散模型里最费参数的那部分活。
这篇工作真正有意思的点在于,它不是单独做一个“量子生成器”,而是直接站在现成的时间序列扩散框架上做改造。也就是说,基础骨架并没有推倒重来,而是把经典去噪模块里最重的前馈神经网络替换成量子模块。这个思路很务实:先承认经典扩散模型已经很强,再问一句——能不能在不把系统搞得太复杂的前提下,把参数压下去,顺便把生成质量抬上去?
论文里还顺手解释了一个很重要的事实:金融时间序列不是普通玩具数据,它往往有重尾分布、波动聚集、非平稳性这些特点。翻译成人话就是:市场不会老老实实按正态分布走,涨跌经常扎堆来,历史数据也不是越多越好,太久远的数据反而可能把模型带偏。也正因为这样,金融时间序列特别适合拿来检验生成模型到底是在“真学”,还是只是在“复读”。
三合一架构:从QNN到混合量子Transformer
先把结构捋顺。原始的 Diffusion-TS 用的是 encoder-decoder transformer 来做去噪,因为 transformer 擅长处理序列依赖,既能抓短期变化,也能看长距离关系。它靠的不是卷积那种“邻居优先”,而是自注意力机制,能动态衡量不同时间步之间的关系。对于时间序列生成来说,这种能力很关键,因为市场走势往往不是只看前一天,而是要看前后若干天的联动。
QDiffusion-TS 的改造方式很直接:把 transformer 编码器和解码器中的前馈神经网络,全部换成量子神经网络。论文里给出的量子模块不是摆设,而是一个完整的参数化量子电路流程:先通过编码电路把输入映射到量子态,再经过带控制旋转门的参数化电路,最后测量输出成经典结果。这个过程本质上就是让量子电路承担“特征变换器”的角色。
图2:生成数据与真实数据中心矩误差对比。这里展示的是均值、方差、偏度、峰度等中心矩的平均绝对误差。量子模型在多数特征上误差更低,尤其是方差拟合更稳,这对金融时间序列很重要,因为方差往往决定了“像不像真的市场”。
最夸张的地方在参数量。论文显示,单个被替换的前馈模块参数从 33088 变成了 36,几乎是三位数级别的缩减。整网参数则从 589030 降到 461254,整体减少约 20%。这意味着什么?不是“模型突然轻得像羽毛”,而是把最贵的那部分计算换成了更紧凑的表达方式。对工程侧来说,这种变化很现实:参数少,训练和部署的压力就能少一点,尤其在未来量子硬件逐渐可用的时候,混合架构的空间会更大。
不过这里也得泼一点冷水。参数少,不等于自动更强;量子电路也不是白送的。它需要编码、测量、硬件映射,训练和调参都更敏感。所以这篇论文真正值得看的,不是“量子赢麻了”这种情绪化结论,而是它证明了:在一个已经成熟的生成框架里,量子模块可以作为高压缩率替代件,且不必牺牲生成质量。
实验验证:数据生成与下游预测双丰收
这篇论文的实验设计比较讨喜,因为没有只盯着“生成样本像不像”,而是分成了两层:一层看统计分布是否贴近真实数据,一层看这些合成数据能不能真的帮下游任务提分。这个思路比单纯堆一个漂亮图更靠谱,毕竟生成模型最后还是要落回“有没有用”。
在数据生成层面,论文拿苹果和亚马逊的金融数据做了对比。评价指标包括中心矩、Wasserstein 距离和 Kolmogorov-Smirnov, KS 统计量。前者可以理解为“两个分布差得有多远”,后者则是在比较两个样本分布形状是否一致。说白了,一个看距离,一个看长相,两个一起上,能更稳地判断生成质量。
图3:生成分布与真实分布对比。红色是量子模型,蓝色是经典模型。可以看到,量子模型在两个数据集上都更接近真实分布,整体 Wasserstein 距离平均降低约 44%。其中亚马逊数据集上的改善更明显,平均降幅更大,说明量子模块在某些更复杂的分布上反而更占便宜。
更有意思的是,论文还看了训练样本数量变化时的表现。结果显示,在小数据量下,两种模型差不多;数据变多后,量子模型大多数情况下统计距离更低。这个结论很重要,因为它并没有硬拗“量子天然适合小样本”这种老故事,而是更老实地说明:优势更像来自表达能力和分布拟合能力,而不是简单地把“小样本神话”再讲一遍。
图4:不同训练样本数量下的统计距离对比。随着训练样本增加,量子模型在多数设置里保持更低的 Wasserstein 距离和 KS 统计量,说明它对数据分布的刻画更稳定,而不是只在某个固定数据规模下“碰巧运气好”。
下游任务则更接地气。作者用双向长短期记忆网络,也就是 Bidirectional Long Short-Term Memory, BiLSTM,去预测收盘价,并把合成数据按不同比例加入训练集。结果很直接:有了合成数据之后,预测误差明显下降,RMSE 最高能降约 71%。这说明生成数据不只是“看起来像”,而是真的能给预测模型提供有效增广。
图5:下游预测任务中的RMSE和R2表现。训练集加入合成数据后,两个数据集的预测性能都明显改善,且在 1:5 左右达到饱和。更关键的是,量子模型和经典模型在峰值预测精度上非常接近,说明量子版本并没有为了省参数而把可用性砍掉。
论文还做了一个很值得点赞的对照:用更多真实历史数据去扩充训练集,结果反而经常变差。这个现象并不奇怪,因为金融时间序列强非平稳,太久远的数据可能引入分布漂移。相比之下,合成数据是从当前训练分布里采样出来的,反而更像“同一时代的样本补丁”。这点非常实用,也解释了为什么生成式增广在金融场景里经常比盲目加历史数据更靠谱。
量子硬件实战:噪声反而带来惊喜
如果说前面的结果已经够有意思,那硬件验证就是这篇论文最“会整活”的部分。作者把模型放到 IQM Emerald 量子设备上跑推理,看看真实量子硬件的噪声会不会把结果搞崩。通常大家对硬件噪声的第一反应是“完了”,但这篇论文给出的结论偏偏有点反直觉:硬件版不但没明显翻车,统计距离还略优于模拟版。
图6:经典模型、模拟量子模型与硬件量子模型对比。这里的重点不是“硬件一定更强”,而是硬件执行结果和模拟结果非常接近,甚至在部分统计指标上更好。论文给出的解释是,硬件噪声可能给生成过程增加了额外随机性,反而让样本更贴近真实分布。
这部分信息量很大,因为它至少说明了两件事。第一,这套方法不是只会在仿真器里“纸上谈兵”,已经能在真实设备上走通推理流程。第二,量子硬件噪声在生成任务里不一定总是坏事,某些情况下它甚至可能成为一种可利用的随机扰动来源。当然,这不意味着以后大家都该故意拿噪声当特性卖点,毕竟硬件噪声的可控性和稳定性依然是大问题。但至少这篇工作说明,真实硬件并没有把方向直接判死刑。
从工程视角看,这篇论文最值得记住的不是“量子赢了经典”,而是它把一个相当现实的命题摆到了台面上:当模型越来越大时,是否可以用更紧凑的量子模块保住生成质量,甚至在某些分布上做得更好。如果未来量子硬件规模和稳定性继续提升,这类混合架构可能会先在生成任务里找到落脚点,而不是先去和最复杂的大语言模型硬碰硬。
龙迷三问
这篇论文到底解决了什么问题?它解决的是“生成模型太大、太贵、还不一定更好”的老问题。作者把量子神经网络嵌入时间序列扩散模型,用更少参数生成更像真实金融数据的样本,并且还能帮助下游预测任务提分。
文中的 Wasserstein 距离和 KS 统计量是什么意思?它们都是衡量两个分布像不像的指标。Wasserstein 距离更像“搬运成本”,看把一个分布搬成另一个分布要花多大代价;KS 统计量则看两个样本分布的最大差异,数值越小越像。
为什么这篇工作强调金融时间序列?因为金融数据很难伺候,非平稳、重尾、波动聚集都很常见。能在这种数据上把分布学得更准,说明方法不是只会在简单玩具数据上演戏,实际迁移到其他时间序列任务时也更有参考价值。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆。把量子神经网络嵌入时间序列扩散模型,这个组合不算常规,但不是为了拼概念,方向是成立的。
实验合理度:★★★★☆。既看分布拟合,也看下游预测,还上了真实量子硬件,链条比较完整。
学术研究价值:★★★★☆。它回答了一个很现实的问题:量子组件能不能在生成任务里换来更高参数效率。
稳定性:★★★☆☆。模拟和硬件结果都不错,但硬件实验规模仍偏小,离大规模验证还有距离。
适应性以及泛化能力:★★★☆☆。目前只在金融时间序列上验证,跨领域泛化还没被证明。
硬件需求及成本:★★★☆☆。参数省了,但量子编码、测量和硬件访问成本并不低,别把“少参数”误读成“低成本万能钥匙”。
复现难度:★★★★☆。经典部分可复现,量子硬件部分门槛明显更高。
产品化成熟度:★★★☆☆。更像面向未来的混合架构探索,离工业级流水线还有一段路。
可能的问题:量子优势目前更多体现在特定结构和特定任务上,是否能稳定推广到更复杂的真实业务,还需要更大规模、更严格的对照实验。
Waller, J., Caruso, F., Makris, D., Nilavalan, R. & Liang, X. Quantum Generative Diffusion Model for Real-World Time Series. arXiv preprint arXiv:2606.27561 (2026).
Ho, J., Jain, A. N. & Abbeel, P. Denoising diffusion probabilistic models. Advances in Neural Information Processing Systems 33 (2020).
Yuan, X. & Qiao, Y. Diffusion-TS: Interpretable diffusion for general time series generation. ICLR 2024.
Benedetti, M., Lloyd, E., Sack, S. & Fiorentini, M. Parameterized quantum circuits as machine learning models. Quantum Science and Technology 4 (2019).
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。量子模型不只会“算”,还开始学会“造数据”了。想继续追前沿论文、开源代码和AI招聘,欢迎加入龙哥读论文星球与微信群,扫码来聊~"阅读原文",查看更多原论文细节哦!

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

