← 返回 PaperDaily 前沿研究

ICLR 2026级别新招:e2eTD把零售层级预测压到5分钟

零售预测最怕两件事:一是算得慢,二是上下层对不上。本文这个 e2eTD 很会省事——只盯住少量更好预测的上层序列,再把概率样本一路“分糖果”分回底层,既快又一致。

ICLR 2026级别新招:e2eTD把零售层级预测压到5分钟
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
零售预测最怕两件事:一是算得慢,二是上下层对不上。本文这个 e2eTD 很会省事——只盯住少量更好预测的上层序列,再把概率样本一路“分糖果”分回底层,既快又一致。


原论文信息如下:
论文标题:
End-to-end probabilistic hierarchical forecasting of large hierarchies via probabilistic top-down
发表日期: 2026年06月
发表单位: SUPSI, Istituto Dalle Molle di Studi sull’Intelligenza Artificiale (IDSIA), Lugano, Switzerland
原文链接: https://arxiv.org/pdf/2606.26774v1.pdf

传统预测方法的痛点:成本高、假设强、不一致

零售预测这件事,表面看像“猜明天卖多少”,实际上是个层层套娃的工程:最底层是单品-门店的销量,上面还有门店、品类、地区、全局总量。真正麻烦的地方不在“预测”两个字,而在“预测完还得对得上”。如果总量和分项对不上,仓库、补货、排产、预算就会一起犯迷糊,最后谁都像在跟一份不一致的需求清单打架。
传统做法通常分成两类:一类是先分别把每条序列都预测出来,再做“协调/修正”;另一类是从一开始就让模型端到端地学整个层级。前者的问题是,层级一大,算力和工程复杂度就跟着起飞;后者的问题是,很多方法为了端到端,顺手把模型也做成了“重装备选手”,训练慢、部署重、对硬件不友好。更尴尬的是,零售底层序列大多是间歇性需求,也就是“平时很安静,偶尔突然来一嗓子”,这种数据对复杂模型并不总是友好。
本论文先把问题说透了:预测不仅要准,还要“概率上一致”。这里的“概率一致”不是说某个均值看起来差不多,而是指每一次随机抽样出来的未来场景,都必须满足层级约束。也就是说,总量样本要等于子项样本之和,不能出现“上面说卖了100,下面加起来只有87”的灵异事件。
图1:一个包含4个底层序列和3个上层序列的层级结构
图1:一个包含4个底层序列和3个上层序列的层级结构。这个小图的意义很大:它把“层级预测”最核心的矛盾摆到了台面上——上层是汇总,下层是细颗粒度,二者必须互相咬合。
为了说明这种咬合关系,论文给出了最基本的层级约束。比如图里的总量 Z,等于中间层 A、B 之和;B 又等于 BA、BB 之和。这个关系看起来像小学加法,实际却是整个方法的地基。
公式:层级中的加总关系
这条公式表示:上层序列可以由下层序列相加得到。它的中文意思很朴素,但后面所有“概率自上而下”的操作,都是围着它转的。

e2eTD:用少量平滑序列预测整个零售层级

这篇论文的方法名叫 e2eTD,全称是 end-to-end probabilistic top-down,中文可以理解成“端到端的概率自上而下预测”。它的脑回路很直接:既然底层太吵、太零碎、太难学,那就别死磕所有底层序列,先挑一小撮更平滑、更好预测的上层序列来做主力,再把这些概率预测一路分发回底层。
这个思路有点像班主任不再挨个盯着全班四十个同学写作业,而是先抓住几个“班干部”把方向定住,再通过层级关系把要求传下去。别小看这一招,零售层级里真正难预测的往往是底层,真正更稳定的往往是上层;而上层预测一旦靠谱,后面下发样本就顺理成章了。
图2:e2eTD方法总览
图2:e2eTD方法总览。整套流程可以概括成五步:先选一部分平滑的上层序列,再对这些序列做概率预测,然后做协调保证上层一致,接着通过概率自上而下采样把样本分到更底层,最后用底层样本向上求和,得到全层级一致的联合预测。
这里要特别解释几个基础概念。概率预测不是给一个点,而是给一串可能的未来样本;一致预测则要求这些样本在层级上彼此不打架。换句话说,不只是“均值看起来对”,而是“每一条未来剧本都自洽”。
论文里的一个关键选择是:只预测大约 0.3% 的层级序列。这个数字听着像“只做了个小动作”,但恰恰是它让计算量从“全家总动员”变成“抓重点办事”。因为这些被选中的上层序列更平滑、更少噪声,也更适合用传统时间序列模型去拟合。
公式:层级矩阵形式
这条矩阵公式把“上层等于底层加总”写成了统一形式。A 是聚合矩阵,里面只有 0 和 1,谁属于谁、谁汇总谁,一眼就能看出来。

关键创新:概率自上而下的采样算法

这篇论文最有意思的地方,不是“先预测上层”这么简单,而是它怎么把上层的概率样本,有分布地拆回底层。传统 top-down 方法通常是拿历史比例硬切,像切蛋糕一样按固定份额分下去;可现实里的销量比例并不是铁板一块,今天 A 店多一点,明天 B 店多一点,历史比例只是个粗糙近似。
e2eTD 的做法更像“概率版切蛋糕”:它不是拿一个固定比例去分,而是先估计底层各部分历史上的联合分布,再在“总量固定”的前提下,从所有可能的拆分方案里按概率抽一个。这样既保住了总量一致性,又保住了底层之间的相关性,不会把本来一起涨一起跌的商品拆成互不相干的孤岛。
图3:一个最小层级,包含1个上层序列和2个底层序列
图3:一个最小层级,包含1个上层序列和2个底层序列。论文先在这个最小场景里讲清楚算法:已知上层总量 z,要在所有满足 a+b=z 的拆分里,按历史联合分布给每一种拆法分配权重,然后随机抽样。
对应的采样公式也很直白:先把所有可行拆分的权重算出来,再归一化成概率。这里的 π̂A,B 表示 A、B 的历史联合分布估计,wj 则是第 j 种拆法的概率权重。说人话就是:总量已经定了,接下来不是瞎分,而是“看历史上哪种分法更像真的”。
公式:底层样本对的抽样结果
这条公式表示,最终要抽到的是一组组底层样本对。每一对都要满足加总约束,所以它不是普通随机数,而是“带规矩的随机数”。
公式:未归一化权重
这个公式是在算每一种拆分方案的原始权重。直觉上,某个拆分如果在历史联合分布里常见,它被抽中的概率就更高。
公式:归一化后的抽样概率
这一步把原始权重变成真正的概率分布。好处是,算法不需要强行假设底层独立,也不需要把所有复杂性都塞进一个巨型神经网络里。
更妙的是,多层拆分不是一次性把 416 个底层全摊开,而是先二分,再二分,再二分,像一棵二叉树那样递归往下剥。论文在 M5 的 Hobbies 1 这条分支上就演示了这件事:先把 416 个底层商品分成两半,再把每一半继续拆,直到最后落到单个商品。这样做既保持了层级一致,又把“高维拆分”变成了一连串小问题,计算上友好得多。
图4:Hobbies 1下416个底层序列的递归二分拆分
图4:Hobbies 1下416个底层序列的递归二分拆分。这个图的重点不是“树画得多漂亮”,而是说明大层级可以被拆成很多个局部的二元分配问题,避免一次性面对巨大的组合爆炸。
估计联合分布时,论文没有搞得特别玄学,而是用了比较务实的组合:底层边际用 泊松分布负二项分布,依赖关系用 copula 建模。copula 的作用可以理解成“把各自的边际分布和它们之间的相关性拼起来”,它的英文全称是 copula,中文常译为“连接函数”或“耦合函数”,这里引用的是经典概率统计里的概念,Sklar 定理是它的理论基础。
图5:A和B的联合分布示意,展示不同相关性下的Plackett copula效果
图5:A和B的联合分布示意,展示不同相关性下的 Plackett copula 效果。这里最关键的不是“选了什么分布”本身,而是它能快速、显式地把“两个底层之间到底是一起涨还是一起跌”描述出来。
为了让这套东西跑得足够快,论文还做了不少工程化小优化。比如相同总量的样本会批量处理,避免重复算权重;参数估计不用慢吞吞的最大似然,而是用矩匹配和斯皮尔曼相关反推参数。别看这些不是“论文里最炫”的部分,但在 4 万条、30 万条时间序列面前,这种小优化就是能不能从“能跑”变成“能上线”的分水岭。

实验验证:M5和Favorita数据集的全面对比

实验部分选了两个很有代表性的零售大层级数据集:M5Favorita。前者是层级预测圈里的老熟人,后者则更大、更重,能更好检验方法在超大层级上的可扩展性。论文还专门画了底层序列的零值比例和平均需求分布,目的很明确:先告诉读者,这些数据不是“整齐教材题”,而是典型的间歇性需求现场。
图6:M5和Favorita底层序列零值比例与平均需求分布
图6:M5和Favorita底层序列零值比例与平均需求分布。可以看到底层序列大量为零,而且均值分布差异很大,这就是为什么简单的点预测或者强假设模型在这里常常不够用。
表1:M5和Favorita数据集的层级聚合层次
表1:M5和Favorita数据集的层级聚合层次。这个表的作用是交代清楚层级到底有多大、上中下各有多少层,方便理解后面的计算成本和实验难度。
评价指标上,论文使用的是 WSPL,全称是 weighted scaled pinball loss,中文可以理解为“加权缩放分位数损失”。它是 M5 不确定性竞赛的标准概率评分,越低越好。简单说,这个指标很看重“概率分布给得准不准”,不是只看一个点漂不漂亮。
结果上,e2eTD 在两个数据集上都拿到了各聚合层级中最低的 WSPL,而且在 M5 上如果放到 M5 Uncertainty competition 里,成绩相当于能排到前 11 名。这个结果的含金量在于:它不是只在底层赢一点点,而是从多个聚合层级上都保持了稳定优势,说明方法不是“某一层碰巧蒙对了”,而是整体结构确实更合理。
表2:M5各聚合层级上的WSPL结果
表2:M5各聚合层级上的 WSPL 结果。这里能看出 e2eTD 在不同层级上都比较稳,不是只在某个层级“刷分”,而是整体一致性和精度一起兼顾。
表3:Favorita各聚合层级上的WSPL结果
表3:Favorita各聚合层级上的 WSPL 结果。Favorita 体量更大,能跑出好结果说明这套方法不是只对中等规模数据集友好,在更大层级上也能扛住。
图7:不同预测步长下的累计平均WSPL曲线
图7:不同预测步长下的累计平均 WSPL 曲线。这个图的意思是,随着预测步长变长,e2eTD 的整体表现依然保持得比较平稳,没有出现“前几步还行,后面直接散架”的情况。
计算时间也是这篇论文最有说服力的地方之一。论文在普通笔记本上就能跑:M5 大约 5 分钟,Favorita 大约 20 分钟。对零售场景来说,这不是“锦上添花”,而是能不能每天定时刷新预测的生死线。很多方法论文里很漂亮,真到业务里一算,先被 GPU 账单教育一遍;而 e2eTD 这次明显更像能落地的那类。
表5:各方法计算时间对比
表5:各方法计算时间对比。可以直观看出,e2eTD 在 CPU 上也能保持很好的速度优势,而一些端到端神经方法则明显更重。

消融研究:解开e2eTD的各个“魔法”部分

消融实验的任务,就是把“看起来很神”的方法拆开,看看到底是哪一块在干活。论文这里主要验证了几个关键选择:只预测上层是否真的划算、概率自上而下是否真的有帮助、以及快速参数估计是否会拖后腿。结果说明,这些设计不是花架子,而是互相配合的。
表7:e2eTD消融实验结果
表7:e2eTD 消融实验结果。可以看到,默认配置通常最稳,说明“上层预测 + 概率拆分 + 快速估计”这套组合拳是有效的。
从消融结果能看出一个很重要的结论:e2eTD 的优势并不依赖某个特别复杂的深度网络,而是依赖“先选对预测对象,再用对概率拆分方式”。这件事很像做菜,不一定非得把锅铲升级成火箭推进器,关键是火候和顺序对了,味道就不会差太多。
如果把这篇论文放到更大的背景里看,它其实是在给层级预测提供一种很实用的折中:不是盲目追求“全层级都用大模型硬学”,而是承认零售数据的结构性差异,优先在更平滑、更可预测的层级上建立概率锚点,再把锚点稳稳传回底层。这个思路对大规模业务系统很有吸引力,因为它把精度、速度和一致性三件常常打架的事情,尽量拧到了一起。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“层级零售预测既要概率准确、又要上下层一致、还要足够快”这个三难问题。e2eTD 的核心贡献,是用少量更平滑的上层序列做概率预测,再通过概率自上而下采样把样本传回底层,最后得到全层级一致的联合预测。

文中的 top-down 和 copula 分别是什么意思?top-down 就是“先从上层往下分配”,但这里不是固定比例,而是按历史联合分布随机拆分;copula 则是把各底层序列的边际分布和它们之间的相关性拼起来的工具,中文常译为连接函数或耦合函数,用来描述“谁和谁更容易一起变化”。

为什么只预测一小部分上层序列,反而还能做得更好?因为零售底层常常太稀疏、太噪声,直接建模很费力;上层序列经过聚合后更平滑、更容易预测。先抓住这些更稳的“骨架”,再用概率拆分把细节补回去,既减少了计算量,也降低了底层直接建模的难度。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆ 这个思路不是凭空造新宇宙,而是把端到端、top-down、概率建模做了一个很实用的重组;创新点主要在“只预测少量上层 + 概率拆分回底层”的组合设计。

实验合理度:★★★★☆ 数据集、指标、对比和消融都比较完整,而且还把时间成本单独拿出来讲,比较符合零售预测的真实诉求。

学术研究价值:★★★★☆ 对大规模层级概率预测很有启发,尤其适合间歇性需求场景;它提供的是一条可扩展的工程-统计折中路线。

稳定性:★★★★☆ 方法不依赖超重神经网络,流程也比较清晰,稳定性比很多“demo 很炫、上线很累”的方案更好。

适应性以及泛化能力:★★★☆☆ 对层级/分组零售数据很合适,但对非层级、强外生驱动或结构变化特别剧烈的场景,适配性还要再看。

硬件需求及成本:★★★★☆ 只需要普通笔记本就能跑出不错的时间表现,这点很加分;相较于 GPU 依赖重的方法,成本明显更友好。

复现难度:★★★☆☆ 思路不难懂,但涉及层级构造、分布估计、copula 和采样细节,想完全复现还是要花点功夫。

产品化成熟度:★★★★☆ 在零售补货、库存和规划场景里很有落地潜力,尤其适合大层级、算力有限、又要求概率一致的业务。

可能的问题:方法对历史分布与层级结构有一定依赖,若需求突变、促销冲击或结构频繁变化,固定的 in-sample 联合分布可能不够灵活。


主要参考文献

Lorenzo Zambon, Dario Azzimonti, Giorgio Corani. End-to-end probabilistic hierarchical forecasting of large hierarchies via probabilistic top-down. arXiv:2606.26774v1, 2026.
Sklar, A. (1959). Fonctions de répartition à n dimensions et leurs marges.
Nelsen, R. B. (2006). An Introduction to Copulas. Springer.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。