← 返回 PaperDaily
视觉与图像
华为上交大新作:vDiT不删算子也能提速
视频生成模型最烦的不是“不会画”,而是“画得太慢”。Kaleido不走粗暴删算子那条路,而是盯住潜空间里的通道相关性做复用,结果是加速和画质居然能同时保住。
龙哥读论文
发布于 2026-08-30 00:20:04
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 视频生成模型最烦的不是“不会画”,而是“画得太慢”。Kaleido不走粗暴删算子那条路,而是盯住潜空间里的通道相关性做复用,结果是加速和画质居然能同时保住。
原论文信息如下:
视频生成“慢到哭”?Kaleido让vDiT飞起来
视频生成模型最让人抓狂的地方,不是“生成不出来”,而是“生成出来要等到天荒地老”。尤其是基于视频 diffusion transformer(vDiT,视频扩散 transformer)的方案,画质上去了,算力也跟着起飞,最后常常变成显卡在冒烟,用户在发呆。
Kaleido 的思路很直接:既然扩散步数已经被压下来了,那真正拖后腿的就轮到自注意力了。论文不是继续盲目“砍算子”,而是去潜空间里找通道级别的时空相关性 ,然后把这些相关性变成可复用的计算。说人话就是:能不重算的就别重算,能复用的就直接复用。
自注意力竟是最大“拖油瓶”?
先把背景捋顺。vDiT 的工作方式和普通扩散模型类似:每一轮都要在大量 token 上做一遍完整前向推理,而其中最贵的部分,往往就是自注意力。论文里统计了多个主流模型在两代英伟达 GPU 上的执行时间,结论很扎眼:自注意力占了大头 ,而且随着扩散步数减少,这个瓶颈还会越来越突出。
更关键的是,论文还做了 roofline 分析,说明这些模型大多仍然是计算受限 ,不是单纯的显存带宽不够,而是算得太多。也就是说,想靠“换更大显卡”硬顶,成本会非常不优雅。
论文还指出一个趋势:随着扩散蒸馏、缓存等方法把步数压缩下来,token 序列长度和扩散步数的比例越来越高。翻译成人话就是:以前是“步数多所以慢”,现在更像是“步数少了,但每步太贵”。
秘密藏在通道里:RoPE的“小把戏”
Kaleido 真正有意思的地方,不是“又做了一个稀疏注意力”,而是先把 vDiT 的注意力图摸清楚了。论文发现,主流视频 diffusion transformer 的注意力模式大致分两类:空间模式 和时间模式 。
为什么会这样?论文把锅,或者说功劳,指向了 RoPE。RoPE 的全称是 Rotary Positional Embedding ,中文通常叫旋转位置编码 。在 vDiT 里,不同通道组会分别编码时间、水平和垂直方向的位置,而且不同通道的频率还不一样。于是,某些通道天然更容易主导某个方向上的相关性,最后就长出了这些很有规律的注意力图。
论文还做了一个很直观的验证:故意让不同方向的通道去复用别的方向,结果发现,沿着“自己负责的方向”复用最伤画质 ,沿着其他方向复用则相对更安全。这个实验很像在问:让管时间的通道去管空间,会不会出事?答案是,会,且很明显。
复用大法:不重新计算,直接“复制粘贴”
Kaleido 的核心算法叫channel-wise reuse ,中文可以理解成通道级复用 。它不是把 token 直接砍掉,也不是粗暴跳过注意力,而是先判断相邻 token 在某个方向上是不是足够像,如果像,就复用前面的部分计算结果。
具体来说,算法会先在预设方向上比较相邻 token 的单通道差值,差得越小,越可能复用。论文设置了两个阈值:θth1 和 θth2 。低于第一个阈值就可以完全复用,低于第二个阈值则做部分复用。这里的 RoPE 相关性是“判案依据”,阈值是“放行线”。
为了让硬件更好做,论文还把阈值设计成 8 位定点下的幂次形式。这样一来,相似度判断可以简化成位运算,不必每次都搞复杂浮点比较。对于硬件工程来说,这种“小聪明”非常值钱,因为省下来的往往不是一点点延迟,而是整套数据通路的复杂度。
这一步的本质区别在于:稀疏注意力是“我觉得不重要,所以不算了”;Kaleido 是“我觉得它和前一个很像,所以直接拿前一个的部分结果来用”。前者像删作业,后者像做完一题后,发现下一题只是换了个坐标系,很多中间过程可以沿用。两者对画质的伤害,根本不是一个量级。
除了自注意力,这套复用思路还可以迁移到 cross-attention 和 MLP。区别是,MLP 里只有激活值有时空相关性,权重没有,所以复用的对象要换成激活窗口,而不是权重本身。这个细节很重要,不然很容易把“能复用”理解成“啥都能抄”,那就离翻车不远了。
为了便于实现,论文还引入了窗口式比较:不是拿两个 token 硬比,而是拿一个局部窗口做相似性判断,这样更容易在硬件里映射,也能提高复用率。这里的思路很工程:不是追求数学上最花哨,而是追求“能跑、跑得快、还别太掉画质”。
硬件也要“跟上节奏”:可重构脉动阵列
算法省下来了计算,硬件却不能装作没看见。因为复用之后的数据流会变得很不规整:有些 token 要完全跳过,有些只算一半,有些又得按特定方向拼起来。普通 GPU 的执行方式对这种“东一块西一块”的模式并不友好,容易出现线程分歧、访存杂乱、利用率低下的问题。
因此,Kaleido 没有把希望全押在软件层,而是设计了一个可重构 PE 。PE 的全称是 processing element,中文通常叫处理单元 。这个 PE 可以在不同执行模式之间切换,支持复用后的稀疏数据流,还配合混合精度计算,尽量让“省下来的计算”别把硬件搞成一团乱麻。
更进一步,论文还加了一个数据调度器 。这个模块干的事很像“现场排队管理员”:先把复用模式相近的 token 分到一起,再把兼容的通道配对,尽量让 PE 阵列别闲着。因为同样是“有些数据不用算”,如果调度不好,PE 还是会空转,省下来的理论收益就会被利用率吃掉。
论文里还专门举了一个例子说明:即便两种调度方案有相同的数据稀疏度,PE 利用率也可能天差地别。左边方案很多 PE 直接没活干,右边方案则能把相邻输入合并后一起处理。这个对硬件设计的提醒很现实:省算力不等于省时间,调度不好还是白搭 。
成绩单:5.9倍加速,画质还超强
论文最值得看的,还是结果。Kaleido 在四个主流 vDiT 上评估,包括 HunyuanVideo、Wan、CogVideoX 和 TurboDiffusion,并且和多种近期 diffusion accelerator 做了对比。最终结果是:最高 5.9 倍加速,最高 16.0 倍能耗节省 。这不是“快一点点”,而是能直接改变部署方式的那种提升。
更让人放心的是,论文强调它的画质并没有因为加速而“塌房”。相反,在质量比较里,Kaleido 的生成结果比一些稀疏或跳算方案更稳,尤其是细节和时序一致性方面。论文还给出了 HunyuanVideo 上的定性对比,能看到某些方法会出现模糊、闪烁或纹理断裂,而 Kaleido 更接近原始模型。
从实验逻辑上看,这组结果是可信的。因为它不是只比一个模型、一个数据集、一个指标,而是同时验证了算法有效性、硬件效率和生成质量。尤其是论文专门做了消融:去掉某些硬件组件后性能下降,说明收益不是“玄学联动”,而是确实来自通道复用、可重构 PE 和数据调度这三件事一起配合。
论文还给出了阈值敏感性和长视频扩展性分析。结果表明,阈值在一定范围内变化不会把质量搞崩,说明这套方法对实际部署比较友好;而在更高分辨率、720p 长视频场景下,Kaleido 也能继续保持优势,说明它不是只在“小样本 demo”里好看。
还有一个很现实的点:论文把 Kaleido 和 AdapTiV、Exion 等方法做了对比,结果显示在不同配置下都能保持较强优势。对于真正要上系统的人来说,这种“换场景也不容易掉链子”的特性,比单点 SOTA 更重要。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是视频 diffusion transformer 推理太慢的问题。论文没有简单删掉注意力,而是利用潜空间里的通道级时空相关性做复用,再配合专门硬件,把“算得太多”变成“只算必要部分”。
RoPE、t/x/y 通道这些词是什么意思? RoPE 是 Rotary Positional Embedding,也就是旋转位置编码,用来让模型知道 token 的位置。vDiT 会把通道分成时间、水平和垂直三个方向,不同通道负责不同位置频率,所以复用时不能乱来,得沿着合适方向做。
为什么它比直接做稀疏注意力更靠谱? 因为稀疏注意力是直接跳过一部分计算,容易把视频里的连续性和时序一致性一起砍掉;Kaleido 是复用前面的部分结果,相当于保留结构信息再省计算,所以在同样节省比例下,画质掉得更少。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。创新点不在“提出了一个全新大模型”,而在于把 vDiT 的通道相关性摸透后,做了算法和硬件的协同设计,这种从机理出发的加速路线比单纯稀疏化更扎实。
实验合理度: ★★★★☆。对多个主流 vDiT、多个加速器、多个场景都做了比较,还补了消融和敏感性分析,整体比较完整。若能给更多真实部署场景数据,会更有说服力。
学术研究价值: ★★★★☆。它不只是一个工程优化,而是把“视频扩散里到底哪里可省”这件事讲清楚了,尤其对后续做视频生成加速的人很有启发。
稳定性: ★★★☆☆。方法不是只靠一个阈值硬切,稳定性比很多稀疏方案强,但毕竟还是依赖特定的通道相关性和定点实现,跨模型迁移时仍需验证。
适应性以及泛化能力: ★★★★☆。论文覆盖了多个模型和不同分辨率,说明方法不是只对单一架构有效,但对其他非 RoPE 设计的模型是否同样好用,还需要进一步确认。
硬件需求及成本: ★★★★☆。硬件只增加了 7.9% 面积开销,却换来最高 5.9 倍加速和 16 倍能耗节省,这个账算得挺漂亮。
复现难度: ★★★☆☆。算法思想能懂,工程实现却不轻松,尤其是 PE 重构、调度器和固定点复用细节,复现门槛明显高于纯软件方法。
产品化成熟度: ★★★☆☆。如果目标是视频生成推理加速,这条路线是有产品价值的;但要真正上芯片,还需要更完整的端到端验证和软硬件生态配合。
可能的问题: 方法很聪明,但也很“挑食”:它依赖 vDiT 内部的通道结构和 RoPE 规律,未来模型一旦改编码方式,复用收益可能会打折。
主要参考文献
[1] Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations.
[2] Rotary Positional Embedding (RoPE) 相关工作,视频 diffusion transformer 位置编码基础。
[3] 近期视频生成与 diffusion acceleration 相关工作,包括蒸馏、缓存与稀疏注意力方法。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
视频生成、图像增强、大模型、机器人、AI医疗、AI金融,想找同频讨论就来。