← 返回 PaperDaily
视觉与图像
ICCV 2023新范式被挑战:视频扩散模型为何输给自回归?
视频扩散模型看着很会“画”,但一遇到连续依赖事件就容易露馅。本文用最干净的硬球碰撞任务,把这个短板拆得明明白白。
龙哥读论文
发布于 2026-08-16 11:00:47
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 视频扩散模型看着很会“画”,但一遇到连续依赖事件就容易露馅。本文用最干净的硬球碰撞任务,把这个短板拆得明明白白。
原论文信息如下:
视频扩散模型这几年很会“画未来”,但这篇论文偏偏盯住了一个更扎心的问题:它到底会不会顺着因果链条,一步一步把后果算对 。如果只是补帧、续一段短视频,很多模型看起来都挺像那么回事;可一旦事件开始“接龙”,前一个碰撞会改变下一个碰撞的条件,模型就容易露馅。
这篇工作没有拿花里胡哨的自然视频硬拷问模型,而是选了一个极简但很“损”的测试场:硬球动力学 。几个小球在盒子里弹来弹去,规则简单、结果唯一、没有歧义。正因为如此,模型要是还算不准,就不是“世界太复杂”,而是“算力没有沿着正确方向花”。
论文把这个现象起了个很准的名字:序列性差距 (seriality gap)。意思很直白:任务需要的“串行计算”越来越多,但视频扩散模型的去噪循环,并没有随着链条变长而线性补上这部分能力。
这里要先讲清一个基础概念。视频扩散模型通常不是一次性吐出整段视频,而是从噪声里反复“擦掉脏东西”,最后得到目标视频。这个过程听起来像是在认真思考,但论文的观点很犀利:去噪步数多,不等于真正的串行推理多 。如果骨干网络本身没有把依赖关系算透,再多擦几遍也可能只是把画面擦得更像,不是把因果算得更对。
为了把这个问题钉死,论文设计了两个对照:一个是多球场景 ,碰撞链条会随着预测长度增长;另一个是单球场景 ,长度一样,但没有球-球碰撞,未来可以闭式计算。这样一来,视频越长带来的“算不准”,到底是因为长度本身,还是因为依赖链条更长,就能分得很清楚。
先看最核心的实验结论。论文在五球硬球任务上发现,标准的双向视频扩散模型,随着碰撞链条变长,局部物理精度会明显下降;而自回归生成的误差更平稳,长链下也没那么容易崩。这个差异不是“视频更长所以更难”那么简单,因为在单球控制组里,随着长度增加,双向与自回归之间的差距几乎消失了。
最容易让人误会的是去噪步数。直觉上,扩散模型既然要迭代很多轮,似乎“多迭代几次”就能补上推理能力。论文专门把去噪步数从 10、20、50、100 一路扫到 200,结果很不客气:性能在中等步数后基本平台化,长链任务依旧难啃。换句话说,去噪轮数增加了,但真正能处理依赖链的串行计算并没有同步增加 。
这其实很符合工程直觉。很多人把“更多迭代”理解成“更多思考”,但在这里,迭代更像是对同一份答案做细修,而不是重新把依赖关系一层层算出来。模型能修得更像,不代表它能修得更对。碰撞链条一长,前一步错了,后面就会像多米诺骨牌一样继续歪。
论文没有停留在“发现问题”这一步,而是进一步问:那到底什么东西能补上这块短板?答案非常朴素,也非常工程:把计算做得更串行,或者把骨干做得更深 。
先说架构改法。论文把生成方式从双向生成 ,逐步改成分块生成 ,最后到自回归生成 。这里的自回归(autoregressive)可以理解成“先算前几帧,再拿前面的结果去算后几帧”;分块生成则介于两者之间,一次处理一小段时间窗口。生成越串行,模型越像在按因果顺序做题,而不是把一整张卷子糊在一起涂答题卡。
再说骨干网络。论文比较了加宽和加深两种扩容方式,结果是:深度比宽度更能补序列计算 ,至少在 30 层左右之前,这个趋势非常明显。这个结论对工程师其实很有启发:如果任务本身需要逐步推演状态,单纯把模型做胖,不一定比把模型做深更有效。
论文还给了一个很关键的理论解释。对确定性视频预测来说,如果初始条件已经决定了唯一未来,那么在高斯加噪之后,精确的条件得分 只要算对一次,就足以把那个唯一未来恢复出来。这里的“得分”指的是噪声条件得分函数(noise-conditional score function),英文全称是 Noise-Conditional Score Network, NCSN ,中文可理解为“噪声条件得分网络”。它在扩散模型里负责告诉系统:当前带噪样本应该往哪个方向去噪,才能回到干净数据。
这段理论的意思其实很“反直觉但合理”:如果骨干网络已经把关键状态信息算出来了,那么后续多次去噪更多是在重复调用同一份能力,而不是不断累积新的推理层次。于是,想补短板,不能只盯去噪轮数,而得盯骨干深度、推理分解方式,甚至重新想一类更适合做序列推理的生成目标。
这篇论文最值得记住的,不是“弹球”本身,而是它把一个常被忽略的事实讲透了:视频模型的失败,未必是视觉不够强,也可能是串行计算不够用 。在硬球任务里,这个问题被干净地暴露出来;在更复杂的真实世界视频里,外观、噪声、遮挡、语义歧义会把问题搅得更乱,但并不会自动消灭依赖链条。
论文还做了一个很有意思的补充实验:把墙壁速度做轻微扰动,引入一点随机性。结果趋势依旧类似,说明这个“序列性差距”并不是只在完全确定性的玩具环境里才成立。换句话说,这不是“模型在一个过于理想的世界里翻车”这么简单,而是它在面对需要逐步解析的任务时,确实存在结构性瓶颈。
对实际应用来说,这个结论挺有现实味道。若任务是长时序物理预测、复杂交互模拟、需要按步骤推进的规划问题,单纯依赖“更强的双向去噪”可能不够。更靠谱的方向,是让模型真正拥有可扩展的串行计算能力,比如更深的主干、任务对齐的分块推理,或者干脆换一种更适合做逐步推演的生成范式。
龙迷三问
这篇论文到底解决什么问题? 它不是在比谁生成的视频更好看,而是在问视频扩散模型能不能处理“事件接着事件”的长链推理。论文发现,长链依赖越多,双向扩散越容易掉链子,这就是所谓的序列性差距。
NCSN 是什么意思? NCSN 是 Noise-Conditional Score Network,中文叫“噪声条件得分网络”。它负责估计当前带噪样本往干净样本回去的方向,是扩散模型里最核心的去噪指挥官。
为什么去噪步数增加了,性能还是不行? 因为去噪步数增加的是“重复修正”的机会,不一定增加真正的串行推理能力。若骨干网络没有把依赖链条算清,迭代再多也只是反复擦同一块黑板,不能自动把题目做深。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“视频扩散为什么会在长链依赖上失灵”讲得很透,而且不是停留在经验判断,而是给出了实验和理论两层解释。新意主要在问题定义和“序列性差距”这个切口上。
实验合理度: ★★★★☆
硬球动力学这个测试床非常干净,单球控制组也设计得很到位,能有效排除“只是视频更长”的干扰。唯一的小遗憾是仍然属于合成场景,向真实世界外推时要谨慎。
学术研究价值: ★★★★☆
对视频生成、世界模型和序列推理的交叉研究都有启发。它提醒研究者:有些问题不是“模型不够大”,而是“计算组织方式不对”。
稳定性: ★★★☆☆
在硬球和振动墙设置里都能看到类似趋势,说明结论不算脆。但要直接落到复杂自然视频,还需要更多验证。
适应性以及泛化能力: ★★★☆☆
对“依赖链逐步展开”的任务很有参考价值,但并不是所有视觉任务都适合自回归化。任务结构不对齐时,效果未必这么好。
硬件需求及成本: ★★☆☆☆
训练约 300 个 A100-80GB GPU-days,成本不低。推理时双向扩散也不算轻,真要上产品,算力账得先算明白。
复现难度: ★★★☆☆
实验设置和指标定义比较清楚,但涉及视频扩散训练、硬球模拟器和多种推理分解,工程量不小,不是随手就能复现的轻量工作。
产品化成熟度: ★★☆☆☆
更适合做研究判断和架构启发,不适合直接当成现成产品方案。要进入产品层,至少还需要更强的真实场景验证和更稳定的推理机制。
可能的问题: 结论很清楚,但主要建立在合成物理场景上;对自然视频的外推还不够硬,且理论部分对“确定性”和“精确得分”的假设偏强。
主要参考文献
Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai. The Seriality Gap in Video Diffusion Models. arXiv:2607.13031, 2026.
原文链接:https://arxiv.org/pdf/2607.13031v1.pdf
球弹一下不难,难的是一串都弹对。视频扩散模型这次被硬球物理课“点名”了:想看更多前沿论文、模型拆解和工程视角? 欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称。