← 返回 PaperDaily 视觉与图像

华为上交大新作:vDiT不删算子也能提速

视频生成模型最烦的不是“不会画”,而是“画得太慢”。Kaleido不走粗暴删算子那条路,而是盯住潜空间里的通道相关性做复用,结果是加速和画质居然能同时保住。

华为上交大新作:vDiT不删算子也能提速
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
视频生成模型最烦的不是“不会画”,而是“画得太慢”。Kaleido不走粗暴删算子那条路,而是盯住潜空间里的通道相关性做复用,结果是加速和画质居然能同时保住。


原论文信息如下:
论文标题:
Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations
发表日期:
2026年07月
发表单位:
Shanghai Jiao Tong University, Huawei Technologies, ICT, Chinese Academy of Sciences, Shanghai Qi Zhi Institute
原文链接:
https://arxiv.org/pdf/2607.13770v1.pdf

视频生成“慢到哭”?Kaleido让vDiT飞起来

视频生成模型最让人抓狂的地方,不是“生成不出来”,而是“生成出来要等到天荒地老”。尤其是基于视频 diffusion transformer(vDiT,视频扩散 transformer)的方案,画质上去了,算力也跟着起飞,最后常常变成显卡在冒烟,用户在发呆。
Fig. 1: 扩散视频生成过程示意图
图1:扩散视频生成流程示意图。随机噪声视频先被编码进潜空间,再在多个扩散步里不断去噪,最后解码回 RGB 视频。问题就出在这里:步数一多,推理时间直接拉长。
Kaleido 的思路很直接:既然扩散步数已经被压下来了,那真正拖后腿的就轮到自注意力了。论文不是继续盲目“砍算子”,而是去潜空间里找通道级别的时空相关性,然后把这些相关性变成可复用的计算。说人话就是:能不重算的就别重算,能复用的就直接复用。

自注意力竟是最大“拖油瓶”?

先把背景捋顺。vDiT 的工作方式和普通扩散模型类似:每一轮都要在大量 token 上做一遍完整前向推理,而其中最贵的部分,往往就是自注意力。论文里统计了多个主流模型在两代英伟达 GPU 上的执行时间,结论很扎眼:自注意力占了大头,而且随着扩散步数减少,这个瓶颈还会越来越突出。
Fig. 2: 八个主流 vDiT 在两款英伟达 GPU 上的执行时间分解
图2:八个主流 vDiT 在两款英伟达 GPU 上的执行时间分解。可以看到,自注意力几乎是全场最忙的模块,堪称视频生成里的“时间刺客”。
更关键的是,论文还做了 roofline 分析,说明这些模型大多仍然是计算受限,不是单纯的显存带宽不够,而是算得太多。也就是说,想靠“换更大显卡”硬顶,成本会非常不优雅。
Fig. 3: 八个 vDiT 在两款英伟达 GPU 上的 roofline 分析
图3:八个 vDiT 在两款英伟达 GPU 上的 roofline 分析。结论很朴素:这些模型大体都在“算力墙”这边,不是在“内存墙”那边。
论文还指出一个趋势:随着扩散蒸馏、缓存等方法把步数压缩下来,token 序列长度和扩散步数的比例越来越高。翻译成人话就是:以前是“步数多所以慢”,现在更像是“步数少了,但每步太贵”。
Fig. 4: token 序列长度与扩散步数比例的变化
图4:vDiT 中 token 序列长度与扩散步数的比例逐年上升,说明 attention 计算正在变成更核心的瓶颈。

秘密藏在通道里:RoPE的“小把戏”

Kaleido 真正有意思的地方,不是“又做了一个稀疏注意力”,而是先把 vDiT 的注意力图摸清楚了。论文发现,主流视频 diffusion transformer 的注意力模式大致分两类:空间模式时间模式
Fig. 5: 注意力模式示意图
图5:注意力模式示意图。空间模式像重复的小方块,主要描述单帧内部的空间关系;时间模式则像对角线,主要描述跨帧的时间关系。
为什么会这样?论文把锅,或者说功劳,指向了 RoPE。RoPE 的全称是 Rotary Positional Embedding,中文通常叫旋转位置编码。在 vDiT 里,不同通道组会分别编码时间、水平和垂直方向的位置,而且不同通道的频率还不一样。于是,某些通道天然更容易主导某个方向上的相关性,最后就长出了这些很有规律的注意力图。
Table 1: 不同 vDiT 模型的通道划分
表1:不同 vDiT 模型的通道划分。可以看到,很多模型都会把通道分成 t、x、y 三个方向,这正是后面“按通道复用”的基础。
论文还做了一个很直观的验证:故意让不同方向的通道去复用别的方向,结果发现,沿着“自己负责的方向”复用最伤画质,沿着其他方向复用则相对更安全。这个实验很像在问:让管时间的通道去管空间,会不会出事?答案是,会,且很明显。
Fig. 6: 不同通道组复用对生成质量的影响
图6:不同通道组复用对最终生成质量的影响。上半部分展示复用方向,下半部分展示生成结果,能很直观看到某些方向一旦乱复用,就会带来条纹或时序失真。
Fig. 7: 不同方向复用带来的 MSE 误差
图7:不同方向复用带来的 MSE 误差。整体趋势很清楚:对某个通道组来说,沿着它不负责的方向复用,误差更小。

复用大法:不重新计算,直接“复制粘贴”

Kaleido 的核心算法叫channel-wise reuse,中文可以理解成通道级复用。它不是把 token 直接砍掉,也不是粗暴跳过注意力,而是先判断相邻 token 在某个方向上是不是足够像,如果像,就复用前面的部分计算结果。
Fig. 8: 通道级复用算法概览
图8:通道级复用算法概览。先比较相邻 token 的相似度,再决定是完全复用、部分复用,还是正常计算。这个流程看着简单,实则很“抠门”——但抠得有理有据。
具体来说,算法会先在预设方向上比较相邻 token 的单通道差值,差得越小,越可能复用。论文设置了两个阈值:θth1θth2。低于第一个阈值就可以完全复用,低于第二个阈值则做部分复用。这里的 RoPE 相关性是“判案依据”,阈值是“放行线”。
为了让硬件更好做,论文还把阈值设计成 8 位定点下的幂次形式。这样一来,相似度判断可以简化成位运算,不必每次都搞复杂浮点比较。对于硬件工程来说,这种“小聪明”非常值钱,因为省下来的往往不是一点点延迟,而是整套数据通路的复杂度。
Fig. 9 和 Fig. 10:复用误差与提示词敏感性
图9和图10:左边对比了通道复用与两种“直接跳过计算”的稀疏方案,右边展示不同提示词下阈值敏感性。结果很关键:在相同节省比例下,复用法的 MSE 明显更低,而且阈值对提示词并不敏感,说明这套阈值可以离线定好,不必每次现场调参。
这一步的本质区别在于:稀疏注意力是“我觉得不重要,所以不算了”;Kaleido 是“我觉得它和前一个很像,所以直接拿前一个的部分结果来用”。前者像删作业,后者像做完一题后,发现下一题只是换了个坐标系,很多中间过程可以沿用。两者对画质的伤害,根本不是一个量级。
除了自注意力,这套复用思路还可以迁移到 cross-attention 和 MLP。区别是,MLP 里只有激活值有时空相关性,权重没有,所以复用的对象要换成激活窗口,而不是权重本身。这个细节很重要,不然很容易把“能复用”理解成“啥都能抄”,那就离翻车不远了。
为了便于实现,论文还引入了窗口式比较:不是拿两个 token 硬比,而是拿一个局部窗口做相似性判断,这样更容易在硬件里映射,也能提高复用率。这里的思路很工程:不是追求数学上最花哨,而是追求“能跑、跑得快、还别太掉画质”。

硬件也要“跟上节奏”:可重构脉动阵列

算法省下来了计算,硬件却不能装作没看见。因为复用之后的数据流会变得很不规整:有些 token 要完全跳过,有些只算一半,有些又得按特定方向拼起来。普通 GPU 的执行方式对这种“东一块西一块”的模式并不友好,容易出现线程分歧、访存杂乱、利用率低下的问题。
Fig. 11: 整体硬件架构
图11:Kaleido 的整体硬件架构。系统由多个 PE 阵列、一个向量单元以及若干数据调度器组成,负责把复用算法真正落到芯片上。
因此,Kaleido 没有把希望全押在软件层,而是设计了一个可重构 PE。PE 的全称是 processing element,中文通常叫处理单元。这个 PE 可以在不同执行模式之间切换,支持复用后的稀疏数据流,还配合混合精度计算,尽量让“省下来的计算”别把硬件搞成一团乱麻。
Fig. 12 和 Fig. 13:自注意力计算顺序与 PE 设计
图12和图13:左边展示沿 t 轴复用时的计算顺序,右边展示基于 8 位 MAC 单元的 PE 设计。黄色部分是新增逻辑,核心目标就是让部分结果可以直接继承,而不是反复从片上存储里搬来搬去。
更进一步,论文还加了一个数据调度器。这个模块干的事很像“现场排队管理员”:先把复用模式相近的 token 分到一起,再把兼容的通道配对,尽量让 PE 阵列别闲着。因为同样是“有些数据不用算”,如果调度不好,PE 还是会空转,省下来的理论收益就会被利用率吃掉。
Fig. 16: 数据调度器设计
图16:数据调度器设计。调度器负责把相似复用模式的 token 分组,匹配器负责把兼容通道配对,目标只有一个:提高 PE 利用率。
论文里还专门举了一个例子说明:即便两种调度方案有相同的数据稀疏度,PE 利用率也可能天差地别。左边方案很多 PE 直接没活干,右边方案则能把相邻输入合并后一起处理。这个对硬件设计的提醒很现实:省算力不等于省时间,调度不好还是白搭
Fig. 15: 两种调度方式的 PE 利用率对比
图15:两种调度方式在相同稀疏度下的利用率差异。左边低效,右边高效,原因不是算得不一样,而是排得不一样。
Table 2: Kaleido 架构面积分解
表2:Kaleido 架构面积分解。论文给出的硬件额外开销只有 7.9%,说明这套加速不是靠“堆一大坨硬件”换来的。

成绩单:5.9倍加速,画质还超强

论文最值得看的,还是结果。Kaleido 在四个主流 vDiT 上评估,包括 HunyuanVideo、Wan、CogVideoX 和 TurboDiffusion,并且和多种近期 diffusion accelerator 做了对比。最终结果是:最高 5.9 倍加速,最高 16.0 倍能耗节省。这不是“快一点点”,而是能直接改变部署方式的那种提升。
Fig. 18: 整体性能评估
图18:整体性能评估。可以看到,Kaleido 在速度和能耗上都比已有加速器更有优势,说明算法和硬件是一起发力的,不是单边硬撑。
更让人放心的是,论文强调它的画质并没有因为加速而“塌房”。相反,在质量比较里,Kaleido 的生成结果比一些稀疏或跳算方案更稳,尤其是细节和时序一致性方面。论文还给出了 HunyuanVideo 上的定性对比,能看到某些方法会出现模糊、闪烁或纹理断裂,而 Kaleido 更接近原始模型。
Fig. 17: 视频生成质量对比
图17:视频生成质量对比。论文特别提醒读者放大看细节,因为很多加速方法表面上“还行”,一放大就露馅。
从实验逻辑上看,这组结果是可信的。因为它不是只比一个模型、一个数据集、一个指标,而是同时验证了算法有效性、硬件效率和生成质量。尤其是论文专门做了消融:去掉某些硬件组件后性能下降,说明收益不是“玄学联动”,而是确实来自通道复用、可重构 PE 和数据调度这三件事一起配合。
Fig. 19、Fig. 20、Fig. 21:硬件消融与参数敏感性
图19、图20、图21:硬件组件消融、单个 PE 尺寸敏感性等实验。它们说明 Kaleido 的收益并不是“拍脑袋堆参数”,而是有明确结构支撑的。
论文还给出了阈值敏感性和长视频扩展性分析。结果表明,阈值在一定范围内变化不会把质量搞崩,说明这套方法对实际部署比较友好;而在更高分辨率、720p 长视频场景下,Kaleido 也能继续保持优势,说明它不是只在“小样本 demo”里好看。
Fig. 23 和 Fig. 24:阈值与快动作场景分析
图23和图24:阈值变化对速度与画质的影响,以及快动作提示词下的表现。前者说明参数不算娇气,后者说明遇到剧烈运动时也没有明显崩盘。
还有一个很现实的点:论文把 Kaleido 和 AdapTiV、Exion 等方法做了对比,结果显示在不同配置下都能保持较强优势。对于真正要上系统的人来说,这种“换场景也不容易掉链子”的特性,比单点 SOTA 更重要。
Fig. 25 和 Fig. 26:扩展性与对比实验
图25和图26:高分辨率扩展性,以及与 AdapTiV、Exion 的对比。结论比较明确:Kaleido 不是只在某个角落里好看,而是有一定泛化能力的系统级方案。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是视频 diffusion transformer 推理太慢的问题。论文没有简单删掉注意力,而是利用潜空间里的通道级时空相关性做复用,再配合专门硬件,把“算得太多”变成“只算必要部分”。

RoPE、t/x/y 通道这些词是什么意思?RoPE 是 Rotary Positional Embedding,也就是旋转位置编码,用来让模型知道 token 的位置。vDiT 会把通道分成时间、水平和垂直三个方向,不同通道负责不同位置频率,所以复用时不能乱来,得沿着合适方向做。

为什么它比直接做稀疏注意力更靠谱?因为稀疏注意力是直接跳过一部分计算,容易把视频里的连续性和时序一致性一起砍掉;Kaleido 是复用前面的部分结果,相当于保留结构信息再省计算,所以在同样节省比例下,画质掉得更少。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。创新点不在“提出了一个全新大模型”,而在于把 vDiT 的通道相关性摸透后,做了算法和硬件的协同设计,这种从机理出发的加速路线比单纯稀疏化更扎实。

实验合理度:★★★★☆。对多个主流 vDiT、多个加速器、多个场景都做了比较,还补了消融和敏感性分析,整体比较完整。若能给更多真实部署场景数据,会更有说服力。

学术研究价值:★★★★☆。它不只是一个工程优化,而是把“视频扩散里到底哪里可省”这件事讲清楚了,尤其对后续做视频生成加速的人很有启发。

稳定性:★★★☆☆。方法不是只靠一个阈值硬切,稳定性比很多稀疏方案强,但毕竟还是依赖特定的通道相关性和定点实现,跨模型迁移时仍需验证。

适应性以及泛化能力:★★★★☆。论文覆盖了多个模型和不同分辨率,说明方法不是只对单一架构有效,但对其他非 RoPE 设计的模型是否同样好用,还需要进一步确认。

硬件需求及成本:★★★★☆。硬件只增加了 7.9% 面积开销,却换来最高 5.9 倍加速和 16 倍能耗节省,这个账算得挺漂亮。

复现难度:★★★☆☆。算法思想能懂,工程实现却不轻松,尤其是 PE 重构、调度器和固定点复用细节,复现门槛明显高于纯软件方法。

产品化成熟度:★★★☆☆。如果目标是视频生成推理加速,这条路线是有产品价值的;但要真正上芯片,还需要更完整的端到端验证和软硬件生态配合。

可能的问题:方法很聪明,但也很“挑食”:它依赖 vDiT 内部的通道结构和 RoPE 规律,未来模型一旦改编码方式,复用收益可能会打折。


主要参考文献

[1] Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations.
[2] Rotary Positional Embedding (RoPE) 相关工作,视频 diffusion transformer 位置编码基础。
[3] 近期视频生成与 diffusion acceleration 相关工作,包括蒸馏、缓存与稀疏注意力方法。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
视频生成、图像增强、大模型、机器人、AI医疗、AI金融,想找同频讨论就来。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。