← 返回 PaperDaily 大模型与智能体

多元时序预测新损失CvLoss:114组对比111胜,零推理开销

多元时间序列预测最被忽视的角落,其实是未来变量之间"一起涨跌"的结构关系。这篇来自悉尼科技大学、清华和港科大广州的工作提出CvLoss,一个即插即用的损失正则项,不改模型结构就能在114组受控对比中拿下111胜,推理还零开销。

多元时序预测新损失CvLoss:114组对比111胜,零推理开销
原论文信息如下:
论文标题:
Multivariate Time Series Forecasting needs Cross Variable Loss
发表日期:
2026年08月
论文作者:
Kuiye Ding, Yifan Hu, Hanchen Wang, Hao Xue
发表单位:
University of Technology Sydney, Tsinghua University, The Hong Kong University of Science and Technology (Guangzhou)
原文链接:
https://arxiv.org/pdf/2608.05742v1.pdf

引言:预测模型只盯着"每个点准不准",却丢了"变量间一起涨跌"的结构?

多元时间序列预测(MTSF)是个老任务,但最近几年的研究风向很有意思。输入侧的通道依赖建模被玩出了花:iTransformer把注意力从时间维度翻到变量维度,TimeFilter搞动态图路由,DUET做频域软聚类。可以说,从历史数据里榨取变量间的相关性,各路模型已经卷到了极致。
但问题来了:未来预测那一侧呢?现在的模型几乎清一色采用直接预测(Direct Forecasting, DF)范式,把多变量输出强行拆成一个个独立的标量预测问题,每个变量单独算损失、单独优化。这样做不是不行,只是把物理世界里的"共同演化"给切碎了。想象一下交通流量预测:一场暴雨突袭,城市路网几百个传感器的读数会同时飙升;金融市场上,宏观经济冲击一来,相关资产的收益率几乎同步跳水。这些变量在未来窗口里的联动是真实存在的,可DF目标函数压根不管这事儿。
这篇论文的作者们用一张图把问题挑明了。下面这个ECL(电力负荷)数据集的例子中,(a)是未来窗口里变量间真实的相关系数矩阵,(b)是普通iTransformer用MSE训练后预测序列的相关系数矩阵——明显扁平了许多,对角线以外的结构几乎糊成一片。可光看逐点MSE,这个模型的误差还挺能打。这说明什么?说明逐点损失根本没约束变量间的相对结构。(c)显示,换上本文提出的CvLoss训练后,84.83%的跨变量条目结构误差都降低了。
图1(a)真实结构 图1(b)基线结构 图1(c)CvLoss的改进 图1(d)ECL预测快照
图1:ECL数据集上的动机示例,输入长度H=96,预测长度T=96。(a)(b)为真实未来序列与普通iTransformer预测序列的跨变量相关结构。(c)为CvLoss在全部跨变量条目中84.83%的条项上降低了结构误差。(d)为一个代表性变量的预测快照。
这说明什么?说明逐点损失根本没有约束变量间的相对结构。两个模型就算逐点误差非常接近,它们预测出的多元联合分布形态也可能天差地别。一个模型可能侥幸猜对了每个变量的大致走向,但完全丢失了变量之间的协同关系——对于交通调度、电网负荷分配、投资组合风险控制这类下游任务来说,变量间的结构关系往往比单个变量的绝对数值更重要。

目标间隙:为什么逐点MSE在数学上就配不上多元时间序列

光靠直觉说“变量间结构重要”还不够,论文给了一个更硬核的数学论证。作者从概率推断的视角重新审视了DF目标函数。设整个预测窗口内的残差向量为e = vec(Ŷ - Y),假设残差服从零均值多元高斯分布,其时空协方差矩阵为Σ_ST。在这个假设下,标准的DF损失可以写成:
DF损失等价形式
也就是将每个时间步、每个变量的误差平方加总后取平均。而从极大似然估计的角度看,在真实协方差Σ_ST下,缩放后的负对数似然(Negative Log-Likelihood, NLL)为:
NLL公式
这一对比就暴露出了问题:DF损失本质上等价于假设残差协方差矩阵是一个标量乘以单位阵(即各向同性高斯分布),这意味着不同变量、不同时刻的预测残差之间完全独立。可现实中的多元时间序列几乎不可能满足这个假设——交通流量在暴雨天的同步飙升、金融资产收益率的联动暴跌,都会让残差协方差矩阵的非对角元素显著非零。于是两种目标之间的差异可以写成:
目标间隙公式
当Σ_ST⁻¹确实有非零的离对角元素时,这个差异严格非零。论文把这个理论断层称为目标间隙(Objective Gap)。说白了就是:只要真实数据存在跨变量、跨时间的残差相关性,逐点MSE在数学上就不可能是最优目标——它压根没在优化正确的函数。
这里必须解释一个关键点:论文并没有直接去估计这个巨大的协方差矩阵。因为当预测长度T=720、变量数D=321时,协方差矩阵的条目数超过5×10¹⁰,直接估计是一个病态问题。作者的做法更聪明——不估计精确的协方差,而是用一个稀疏图结构来近似残差场中的条件独立关系。
论文进一步证明了一个有意思的结论:如果把逐点MSE和一个图上的平方全变差惩罚项相加,这个组合恰好等价于一个具有结构化精度矩阵的高斯负对数似然。换句话说,图结构上的边集其实定义了残差场的条件独立结构——两点之间没有边,就表示这两个残差在给定其他节点时条件独立。这个理论闭环让后来设计的CvLoss有了坚实的数学根基,而不是一拍脑袋想出来的启发式惩罚项。定理的适用范围也写得很清楚:它证明“某个非对角项是必要的”,但没有指定具体应该用哪个非对角项,ℓ₁范数的选择是一个经验决策而非理论推导的结果。

CvLoss:把残差场放到图上看全变差,一个正则项同时管住同步与滞后交互

既然逐点MSE缺了结构约束,那自然想到的办法就是补一个结构正则项。论文提出的方法叫跨变量损失(Cross-Variable Loss, CvLoss),设计思路相当清爽。首先把预测窗口的时间轴切成P个不重叠的patch(图像处理里常见的patch划分法,被借用到时间序列上),每个patch长度为L,这样每个变量在每个patch上形成一个节点。
图2:CvLoss工作流概览
图2:CvLoss工作流概览。历史序列X输入模型得到预测Ŷ,同时计算逐点损失L_df和基于patch节点残差的图结构损失L_cv,二者加权融合后端到端优化。
有了节点,就需要定义边。CvLoss的图结构设计考虑了两类交互关系:同步跨变量边(Synchronous edges)连接同一patch索引的不同变量节点,捕捉同一时刻的并发影响——比如暴雨时所有路段同时拥堵;异步跨变量边(Asynchronous edges)则连接不同patch索引的节点,捕捉时滞传播效应——比如某地交通拥堵在半小时后蔓延到相邻区域。默认配置采用全连接图,把所有同步和异步边都纳入,不需要依赖任何领域先验知识。
接下来是损失函数的具体形式。对于每个patch节点v,定义残差向量e_v = ẑ_v - z_v,也就是预测patch与真实patch之间的差。那么CvLoss就是所有边上残差差值的平均绝对值:
CvLoss核心公式
从图论角度看,这其实是在残差场上施加了一个ℓ₁范数的图全变差(Graph Total Variation)正则化。逐点损失管的是“每个残差要小”,CvLoss管的是“有边连接的两个节点的残差模式要一致”。两件事互相补充:前者保证绝对精度,后者保证结构一致性。
为什么用ℓ₁范数而不是ℓ₂范数?作者在附录里做了专门的对比实验。直观理解,ℓ₁对少数几个特别大的边误差不敏感,不会因为某个变量发生局部异常(比如传感器故障、突发冲击)而让整个模型的梯度被带偏。当某些变量出现特异性的剧烈波动时,ℓ₁形式的惩罚允许模型在个别边上出现较大偏差,同时仍然保持整体结构的一致性。这相当于在图结构上引入了一定程度的鲁棒性。
最终的训练目标是一个加权组合:
总损失公式
其中α是一个固定的超参数,在验证集上选取,训练过程中不学习。α ∈ (0,1)控制了结构正则的相对强度。注意最极端的情况:当α→1时,如果只剩下结构惩罚,模型可以学到一个所有残差都相等的平凡解(e_i = e_j = c ≠ 0)来把损失归零。所以L_df项虽然在形式上“传统”,但在数学上是必不可少的绝对锚定——它把模型摁在真实值附近,防止整体漂移。这个细节说明作者考虑问题还是比较周全的。
对工程落地来说还有一个非常友好的特性:CvLoss只是在训练时增加了一个正则项,推理时完全不参与计算。也就是说,模型部署后的预测速度与原来一模一样,零额外开销。这个“训练时多花一点点,推理时一分不多花”的特性,对实际系统非常有吸引力。

即插即用的威力:7种骨干网络、114组对比、111胜2平1负

说一千道一万,一个损失函数好不好用,最终要看实验结果。CvLoss的定位是即插即用的正则项,所以论文实验设计的核心思路是:保持骨干网络、数据划分、训练流程完全不变,只把损失函数从标准的MSE换成“MSE+CvLoss”,然后看指标怎么变。这种控制变量的对比方式,把变量数压缩到只有一个——损失项本身。
表1:总体预测性能
表1:CvLoss在8个标准数据集上与10种现有方法的总体预测性能对比(MSE/MAE,越低越好)。
先看几个让人眼前一亮的数字。在ECL数据集上,CvLoss将MSE从0.178(iTransformer)压到0.157,降幅约12%;在Traffic上,MSE从0.428降到0.407;在PEMS03上,MSE从0.096降到0.079。7个数据集全部取得最佳MSE,6个数据集同时拿到最佳MAE——注意这里比的不是“CvLoss加持的模型 vs 原模型”,而是“CvLoss加持的TimeFilter”和其他所有模型(包括原版TimeFilter)之间的比较。这意味着CvLoss不是锦上添花,而是直接把模型推到了新高度。
论文的核心实验设计其实是一个“骨干网络受控对比”(Backbone-controlled comparison),见下表:
表2:骨干网络受控对比汇总
表2:骨干网络受控对比汇总。每个对比都是同一个骨干网络在标准目标函数和CvLoss目标函数下的表现差异,唯一变化的就是损失函数。W/T/L分别统计CvLoss更好、持平、更差的测试单元数量,最后两列给出平均相对误差下降率。
这个表格的结果相当震撼:在7种骨干网络(iTransformer、TQNet、TimeFilter、PatchTST、Crossformer、TimesNet、DLinear)上,对114组(模型, 数据集, 指标)三元组做对比,CvLoss拿下了111胜2平1负。唯一输掉的那组是Solar数据集,CvLoss的MSE是0.218,普通TQNet是0.197——这个数字也说明CvLoss并不是万能的,在个别数据集上可能反而有害。
除了跟骨干网络默认训练目标对比,论文还做了跟其他学习目标的对比——包括形状动态时间规整(Shape-DTW)、时间对比损失、基于能量分数的目标等。CvLoss在这些对比中也稳定领先:
表3:与其他学习目标的对比
表3:与其他时间序列预测学习目标的可比结果。CvLoss在大多数数据集和指标上取得最佳或次佳表现。
更直观的提升效果可以参考下图——不同骨干网络在ETF类数据集上应用CvLoss前后的误差变化。几乎所有模型的误差柱状图都在下降,且下降幅度超过50%置信区间的误差范围:
图9:不同预测模型使用CvLoss前后的性能对比
图9:(a) ETTm1、(b) ETTm2、(c) ETTh1、(d) ETTh2上不同预测模型使用CvLoss前后的性能对比。误差线代表50%置信区间。
坦白说,一开始看到“111胜2平1负”的统计结论,第一反应是“这也好得不真实了吧”。但仔细看了看实验设计:每张对比图都是同一个骨干网络、同一套超参数、同样的训练轮数,只是换了个损失函数。PaperDaily库内同基准(MSE)下的对比也验证了这一结论的整体方向——但有个别数据集(例如Solar)确实存在CvLoss不升反降的情况,这一点论文的正文和附录都如实报告了。这种坦诚的态度值得肯定。
再看一张可视化结果。下图展示了DF(蓝色)和CvLoss(红色)在ETTm2和ECL数据集上的预测序列对比。可以看到CvLoss的预测曲线更贴近真实值,且在趋势转折处更灵敏:
图3(a)ETTm2预测快照 图3(b)ECL预测快照
图3:DF(蓝色)与CvLoss(红色)的预测序列对比,历史长度H=96。(a)为ETTm2数据集,(b)为ECL数据集。
PEMS03数据集上的动机示例同样值得一看。图5展示的是交通流预测场景,CvLoss在61.98%的跨变量对上降低了结构误差:
图5:PEMS03数据集上的动机示例
图5:PEMS03数据集上的动机示例,输入长度H=96,预测长度T=48。(a)(b)为真实未来序列与iTransformer预测序列的跨变量相关结构。(c)CvLoss在61.98%的跨变量对上降低了结构误差。(d)预测快照:橙色为基线预测,黑色为真实值,蓝色为CvLoss。

消融与诊断:同步边、异步边、α权重,每个设计都不是白给的

一个方法如果只在完整配置下有效,那还不足以令人信服。论文在消融实验上做得很细,逐个解剖了CvLoss的各个设计选择。
首先是图拓扑的消融。论文对比了三种边集构造方式:仅同步边、仅异步边、全连接边。实验结果很清楚地表明:单靠同步边或单靠异步边都能带来一定提升,但全连接边效果最好。这说明多元时间序列中既存在同步的并发效应,也存在跨时间的滞后传播效应,两者都需要覆盖——只抓一端是不够的。
表4:消融实验结果
表4:CvLoss在ECL和Weather数据集上的消融实验结果。Base为未加CvLoss的骨干网络,Sync-only表示只保留同步边,Asynch-only表示只保留异步边,Full表示全连接图(默认配置)。
接下来是ℓ₁范数 vs ℓ₂范数的对比。论文在附录里给出了详细的对照结果:在所有数据集上,ℓ₁范数都优于或持平于ℓ₂范数的平方形式。这验证了作者对鲁棒性的直觉——ℓ₁确实比ℓ₂更能容忍局部异常。
最后是超参数α的敏感性分析。论文在TQNet、TimeFilter、iTransformer和TimeBridge四个模型上,将α从0.1遍历到0.9,看性能曲线的变化。结果非常平稳:
表5:TQNet上不同α的结果 表6:TimeFilter上不同α的结果
表5、表6:TQNet和TimeFilter上不同α取值的实验结果。α在0.3~0.7范围内模型性能保持稳定,说明CvLoss对超参数不敏感,实际使用时不需要精细调参。
α在0.3到0.7这个区间内,模型的MSE和MAE基本没有明显波动。这意味着实际使用CvLoss时,不需要针对不同数据集反复调α,在验证集上随便选一个中间值就能拿到接近最优的效果。这种“不太挑超参”的特性,对于工程团队来说非常友好。
论文里还有一个值得注意的诊断实验:当patch数量增大时,全连接边数量会呈平方级增长。为了控制训练开销,作者设计了随机边采样机制(最多采样1000条边),在保持精度的同时大幅降低计算量。实验显示,在patch数较少时,随机采样几乎不损失精度,但在patch数较大时能带来显著的训练加速:
图12:训练运行时间随patch数量的变化
图12:(a) ETTh2训练运行时间。(b) ECL训练运行时间。虚线表示最多采样1000条边时的随机边采样策略。
PEMS数据集的patch数量非常大,如果不做采样,CvLoss的训练时间会成倍增加。而随机边采样策略在几乎不影响预测精度的前提下,把训练时间压缩到了可接受的范围。作者在这方面做了很实际的计算量控制。

评审意见与龙哥锐评:理论闭环漂亮,但均匀先验与ℓ₁选择仍需打磨

论文最漂亮的地方在于理论闭环。从“目标间隙”的定理出发,严谨地论证了逐点MSE在存在跨变量依赖时与真实NLL之间的数学偏差,然后通过结构化精度矩阵的构造,把MSE加图全变差惩罚的组合与高斯NLL建立了等价关系。这是一条完整的推理链:问题存在→数学归因→统一框架→具体设计→实验验证。每一步都有据可依,不是拍脑袋。
但严格挑刺的话,问题也是有的。最核心的批评在于:全连接图假设所有变量两两之间都存在交互关系,这其实是一个均匀先验——每个变量对都被平等对待,不论它们是否真的有物理或统计上的关联。这就造成了两个问题:一是计算复杂度为O(N²)级别,虽然可以通过边采样缓解,但采样本身引入了随机性;二是在变量极多且大多数变量对之间没有真实关联的场景下,全连接图会引入大量无效甚至有害的边,把有用信号淹没在噪声中。论文在Solar数据集上的失败(唯一一个没有获得提升的数据集)可能就与此有关——Solar的变量是光伏电站,它们之间的相关性可能本身就很弱或很复杂,均匀全连接图反而适得其反。
另一个可以争论的设计选择是ℓ₁范数。文章用附录的对比实验证明了ℓ₁优于ℓ₂²,但ℓ₁全变差更适用于分段常数信号,而时间序列的残差场并不是分段常数的。为什么不用Huber范数或平滑化的ℓ₁,论文没有做进一步考虑。当然,从简洁性的角度说,ℓ₁已经够好用了。
此外,α在(0,1)范围内取固定标量也值得讨论。不同变量之间的相关性强度差异很大,有些变量强耦合、有些几乎独立,用同一个α约束所有边,本质上还是在用均匀先验统治一切。如果改成每条边一个权重或者每个变量一个权重,理论上效果应该会更好,但代价是引入更多的超参数。作者在附录里提到做了一组诊断实验,让两个损失项使用可学习的非归一化权重,但没有把这种做法扩展到逐边加权——这是一个可能的研究方向,也是未来工作可以突破的点。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?多元时间序列预测中,未来变量间的依赖关系长期被逐点损失函数忽视。本文提出跨变量损失CvLoss,以图全变差正则化预测残差场,同时建模同步与异步交互。在7种骨干网络、114组受控对…
这篇工作最值得看的点是什么?CvLoss在114个固定backbone对比(7种backbone×12个数据集×双指标)中改进111个、持平2个、仅输1个,平均相对误差降低MSE 3.39%、MAE 3.61%。在Traffic上MAE降低0.014,iTransf…
这篇工作的边界或风险在哪里?优点:(1) 首次系统揭示DF目标函数在跨变量依赖下的目标间隙(Objective Gap),理论分析严密(定理3.1与命题3.2形成完整闭环);(2) 方法即插即用、模型无关,推理零开销,实用性强;(3) 图全变差视角统一了同步与异步跨…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆提出目标间隙这一概念,从概率推断视角严谨论证逐点MSE的不足,并以图全变差正则填补这一缺口。理论框架有原创性,但图正则本身并非新概念。

实验合理度:★★★★★控制变量的实验设计非常严谨——每个对比都是同一骨干网络、同一数据划分、同一训练流程,唯一变量是损失函数。114组对比中111胜2平1负,还如实报告了失败的案例。

学术研究价值:★★★★☆目标间隙的提出让“损失函数设计”有了新的理论视角,结构化精度矩阵与图拓扑的等价关系也很有启发。全连接图的均匀先验假设还留了改进空间。

稳定性:★★★★☆在绝大多数数据上表现稳定,α在0.3~0.7的宽范围内性能无显著波动。但Solar数据集上出现小幅下降,说明在低信噪比或弱变量相关场景下稳定性有待提高。

适应性以及泛化能力:★★★★☆7种骨干网络、8个数据集、不同预测长度的广泛实验验证了CvLoss的通用性。但全连接图均匀先验在弱相关场景下可能引入噪声,泛化到极端高维场景时需谨慎。

硬件需求及成本:★★★★★推理阶段零开销,训练阶段通过随机边采样把额外成本控制在极低水平。对GPU几乎没有额外要求。

复现难度:★★★★☆方法本身非常简单——在现有训练代码里加一个损失项即可。但论文没有给出官方开源代码,需要根据公式自己实现。

产品化成熟度:★★★★☆即插即用的特性非常适合实际系统。成本极低、无需更改模型部署架构、对超参数不敏感。主要限制是需要对已有训练流程做小幅修改。

可能的问题:全连接图均匀先验假设所有变量对都有相同强度的交互,在弱相关高维场景下可能引入噪声。ℓ₁范数的选择缺少理论推导,α的固定标量设计无法建模异构的相关性强度。Solar数据集上的不升反降提示了CvLoss的边界条件。


主要参考文献

[1] Ding K, Hu Y, Wang H, Xue H. Multivariate Time Series Forecasting needs Cross Variable Loss. arXiv preprint arXiv:2608.05742v1, 2026.
[2] Liu Y, Hu T, Zhang H, et al. iTransformer: Inverted Transformers Are Effective for Time Series Forecasting. ICLR 2024.
[3] Wu H, Hu T, Liu Y, et al. TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis. ICLR 2023.
[4] Nie Y, Nguyen N H, Sinthong P, et al. A Time Series is Worth 64 Words: Long-term Forecasting with Transformers. ICLR 2023.
[5] Zhang Y, Yan J. Crossformer: Transformer Utilizing Cross-Dimension Dependency for Multivariate Time Series Forecasting. ICLR 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
时序预测不是点对点的猜谜,跨变量结构才是隐藏的宝藏。CvLoss用图正则讲透了"变量间一起涨跌"的道理。想第一时间读懂更多硬核论文?扫描下方二维码,添加龙哥助手微信号加群:kangjinlonghelper。备注:研究方向+地点+学校/公司+昵称,和一群爱学习的人一起"沉迷学习"~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。