论文标题:
Multivariate Time Series Forecasting needs Cross Variable Loss
发表日期:
2026年08月
论文作者:
Kuiye Ding, Yifan Hu, Hanchen Wang, Hao Xue
发表单位:
University of Technology Sydney, Tsinghua University, The Hong Kong University of Science and Technology (Guangzhou)
原文链接: https://arxiv.org/pdf/2608.05742v1.pdf
既然逐点MSE缺了结构约束,那自然想到的办法就是补一个结构正则项。论文提出的方法叫跨变量损失(Cross-Variable Loss, CvLoss),设计思路相当清爽。首先把预测窗口的时间轴切成P个不重叠的patch(图像处理里常见的patch划分法,被借用到时间序列上),每个patch长度为L,这样每个变量在每个patch上形成一个节点。图2:CvLoss工作流概览。历史序列X输入模型得到预测Ŷ,同时计算逐点损失L_df和基于patch节点残差的图结构损失L_cv,二者加权融合后端到端优化。有了节点,就需要定义边。CvLoss的图结构设计考虑了两类交互关系:同步跨变量边(Synchronous edges)连接同一patch索引的不同变量节点,捕捉同一时刻的并发影响——比如暴雨时所有路段同时拥堵;异步跨变量边(Asynchronous edges)则连接不同patch索引的节点,捕捉时滞传播效应——比如某地交通拥堵在半小时后蔓延到相邻区域。默认配置采用全连接图,把所有同步和异步边都纳入,不需要依赖任何领域先验知识。接下来是损失函数的具体形式。对于每个patch节点v,定义残差向量e_v = ẑ_v - z_v,也就是预测patch与真实patch之间的差。那么CvLoss就是所有边上残差差值的平均绝对值:从图论角度看,这其实是在残差场上施加了一个ℓ₁范数的图全变差(Graph Total Variation)正则化。逐点损失管的是“每个残差要小”,CvLoss管的是“有边连接的两个节点的残差模式要一致”。两件事互相补充:前者保证绝对精度,后者保证结构一致性。为什么用ℓ₁范数而不是ℓ₂范数?作者在附录里做了专门的对比实验。直观理解,ℓ₁对少数几个特别大的边误差不敏感,不会因为某个变量发生局部异常(比如传感器故障、突发冲击)而让整个模型的梯度被带偏。当某些变量出现特异性的剧烈波动时,ℓ₁形式的惩罚允许模型在个别边上出现较大偏差,同时仍然保持整体结构的一致性。这相当于在图结构上引入了一定程度的鲁棒性。最终的训练目标是一个加权组合:其中α是一个固定的超参数,在验证集上选取,训练过程中不学习。α ∈ (0,1)控制了结构正则的相对强度。注意最极端的情况:当α→1时,如果只剩下结构惩罚,模型可以学到一个所有残差都相等的平凡解(e_i = e_j = c ≠ 0)来把损失归零。所以L_df项虽然在形式上“传统”,但在数学上是必不可少的绝对锚定——它把模型摁在真实值附近,防止整体漂移。这个细节说明作者考虑问题还是比较周全的。对工程落地来说还有一个非常友好的特性:CvLoss只是在训练时增加了一个正则项,推理时完全不参与计算。也就是说,模型部署后的预测速度与原来一模一样,零额外开销。这个“训练时多花一点点,推理时一分不多花”的特性,对实际系统非常有吸引力。
即插即用的威力:7种骨干网络、114组对比、111胜2平1负
说一千道一万,一个损失函数好不好用,最终要看实验结果。CvLoss的定位是即插即用的正则项,所以论文实验设计的核心思路是:保持骨干网络、数据划分、训练流程完全不变,只把损失函数从标准的MSE换成“MSE+CvLoss”,然后看指标怎么变。这种控制变量的对比方式,把变量数压缩到只有一个——损失项本身。表1:CvLoss在8个标准数据集上与10种现有方法的总体预测性能对比(MSE/MAE,越低越好)。先看几个让人眼前一亮的数字。在ECL数据集上,CvLoss将MSE从0.178(iTransformer)压到0.157,降幅约12%;在Traffic上,MSE从0.428降到0.407;在PEMS03上,MSE从0.096降到0.079。7个数据集全部取得最佳MSE,6个数据集同时拿到最佳MAE——注意这里比的不是“CvLoss加持的模型 vs 原模型”,而是“CvLoss加持的TimeFilter”和其他所有模型(包括原版TimeFilter)之间的比较。这意味着CvLoss不是锦上添花,而是直接把模型推到了新高度。论文的核心实验设计其实是一个“骨干网络受控对比”(Backbone-controlled comparison),见下表:表2:骨干网络受控对比汇总。每个对比都是同一个骨干网络在标准目标函数和CvLoss目标函数下的表现差异,唯一变化的就是损失函数。W/T/L分别统计CvLoss更好、持平、更差的测试单元数量,最后两列给出平均相对误差下降率。这个表格的结果相当震撼:在7种骨干网络(iTransformer、TQNet、TimeFilter、PatchTST、Crossformer、TimesNet、DLinear)上,对114组(模型, 数据集, 指标)三元组做对比,CvLoss拿下了111胜2平1负。唯一输掉的那组是Solar数据集,CvLoss的MSE是0.218,普通TQNet是0.197——这个数字也说明CvLoss并不是万能的,在个别数据集上可能反而有害。除了跟骨干网络默认训练目标对比,论文还做了跟其他学习目标的对比——包括形状动态时间规整(Shape-DTW)、时间对比损失、基于能量分数的目标等。CvLoss在这些对比中也稳定领先:表3:与其他时间序列预测学习目标的可比结果。CvLoss在大多数数据集和指标上取得最佳或次佳表现。更直观的提升效果可以参考下图——不同骨干网络在ETF类数据集上应用CvLoss前后的误差变化。几乎所有模型的误差柱状图都在下降,且下降幅度超过50%置信区间的误差范围:图9:(a) ETTm1、(b) ETTm2、(c) ETTh1、(d) ETTh2上不同预测模型使用CvLoss前后的性能对比。误差线代表50%置信区间。坦白说,一开始看到“111胜2平1负”的统计结论,第一反应是“这也好得不真实了吧”。但仔细看了看实验设计:每张对比图都是同一个骨干网络、同一套超参数、同样的训练轮数,只是换了个损失函数。PaperDaily库内同基准(MSE)下的对比也验证了这一结论的整体方向——但有个别数据集(例如Solar)确实存在CvLoss不升反降的情况,这一点论文的正文和附录都如实报告了。这种坦诚的态度值得肯定。再看一张可视化结果。下图展示了DF(蓝色)和CvLoss(红色)在ETTm2和ECL数据集上的预测序列对比。可以看到CvLoss的预测曲线更贴近真实值,且在趋势转折处更灵敏:图3:DF(蓝色)与CvLoss(红色)的预测序列对比,历史长度H=96。(a)为ETTm2数据集,(b)为ECL数据集。PEMS03数据集上的动机示例同样值得一看。图5展示的是交通流预测场景,CvLoss在61.98%的跨变量对上降低了结构误差:图5:PEMS03数据集上的动机示例,输入长度H=96,预测长度T=48。(a)(b)为真实未来序列与iTransformer预测序列的跨变量相关结构。(c)CvLoss在61.98%的跨变量对上降低了结构误差。(d)预测快照:橙色为基线预测,黑色为真实值,蓝色为CvLoss。
消融与诊断:同步边、异步边、α权重,每个设计都不是白给的
一个方法如果只在完整配置下有效,那还不足以令人信服。论文在消融实验上做得很细,逐个解剖了CvLoss的各个设计选择。首先是图拓扑的消融。论文对比了三种边集构造方式:仅同步边、仅异步边、全连接边。实验结果很清楚地表明:单靠同步边或单靠异步边都能带来一定提升,但全连接边效果最好。这说明多元时间序列中既存在同步的并发效应,也存在跨时间的滞后传播效应,两者都需要覆盖——只抓一端是不够的。表4:CvLoss在ECL和Weather数据集上的消融实验结果。Base为未加CvLoss的骨干网络,Sync-only表示只保留同步边,Asynch-only表示只保留异步边,Full表示全连接图(默认配置)。接下来是ℓ₁范数 vs ℓ₂范数的对比。论文在附录里给出了详细的对照结果:在所有数据集上,ℓ₁范数都优于或持平于ℓ₂范数的平方形式。这验证了作者对鲁棒性的直觉——ℓ₁确实比ℓ₂更能容忍局部异常。最后是超参数α的敏感性分析。论文在TQNet、TimeFilter、iTransformer和TimeBridge四个模型上,将α从0.1遍历到0.9,看性能曲线的变化。结果非常平稳:表5、表6:TQNet和TimeFilter上不同α取值的实验结果。α在0.3~0.7范围内模型性能保持稳定,说明CvLoss对超参数不敏感,实际使用时不需要精细调参。α在0.3到0.7这个区间内,模型的MSE和MAE基本没有明显波动。这意味着实际使用CvLoss时,不需要针对不同数据集反复调α,在验证集上随便选一个中间值就能拿到接近最优的效果。这种“不太挑超参”的特性,对于工程团队来说非常友好。论文里还有一个值得注意的诊断实验:当patch数量增大时,全连接边数量会呈平方级增长。为了控制训练开销,作者设计了随机边采样机制(最多采样1000条边),在保持精度的同时大幅降低计算量。实验显示,在patch数较少时,随机采样几乎不损失精度,但在patch数较大时能带来显著的训练加速:图12:(a) ETTh2训练运行时间。(b) ECL训练运行时间。虚线表示最多采样1000条边时的随机边采样策略。PEMS数据集的patch数量非常大,如果不做采样,CvLoss的训练时间会成倍增加。而随机边采样策略在几乎不影响预测精度的前提下,把训练时间压缩到了可接受的范围。作者在这方面做了很实际的计算量控制。
[1] Ding K, Hu Y, Wang H, Xue H. Multivariate Time Series Forecasting needs Cross Variable Loss. arXiv preprint arXiv:2608.05742v1, 2026.[2] Liu Y, Hu T, Zhang H, et al. iTransformer: Inverted Transformers Are Effective for Time Series Forecasting. ICLR 2024.[3] Wu H, Hu T, Liu Y, et al. TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis. ICLR 2023.[4] Nie Y, Nguyen N H, Sinthong P, et al. A Time Series is Worth 64 Words: Long-term Forecasting with Transformers. ICLR 2023.[5] Zhang Y, Yan J. Crossformer: Transformer Utilizing Cross-Dimension Dependency for Multivariate Time Series Forecasting. ICLR 2023.