← 返回 PaperDaily 视觉与图像

上交大华为联手:vDiT重用计算省16倍能效

视频扩散Transformer最烦的不是“能不能生成”,而是“生成一段视频到底要烧掉多少算力”。Kaleido不跟稀疏注意力硬卷,而是从潜空间通道相关性下手,顺手把算法和硬件一起改了,思路很工程,也很狠。

上交大华为联手:vDiT重用计算省16倍能效
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
视频扩散Transformer最烦的不是“能不能生成”,而是“生成一段视频到底要烧掉多少算力”。Kaleido不跟稀疏注意力硬卷,而是从潜空间通道相关性下手,顺手把算法和硬件一起改了,思路很工程,也很狠。


原论文信息如下:
论文标题:
Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations
发表日期:
2026年01月
发表单位:
Shanghai Jiao Tong University; Huawei Technologies; ICT, Chinese Academy of Sciences; Shanghai Qi Zhi Institute
原文链接:
https://arxiv.org/pdf/2601.04194.pdf

视频生成新瓶颈:注意力计算如何“吃光”算力?

视频扩散模型最让工程师头疼的地方,不是“能不能生成”,而是“生成一段像样的视频到底要烧掉多少算力”。这篇论文盯住的就是这个现实问题:视频扩散Transformer,简称 vDiT,英文全称是 video diffusion transformer,中文就是“视频扩散Transformer”。它的工作方式并不神秘:先把噪声视频压到潜空间,再在多个去噪步里一遍遍预测噪声,最后再解码回视频。
Fig. 1:扩散视频生成流程示意图
Fig. 1:扩散视频生成流程示意图。噪声视频先被编码进潜空间,再在多个去噪步中反复处理,最终还原成输出视频。
问题在于,早期大家总盯着“去噪步数太多”这个瓶颈,结果近年的蒸馏、缓存等方法把步数压下去了,新的老大难就浮出水面了:自注意力。论文统计了八个主流 vDiT 的执行时间,结论很直接:自注意力几乎把总时间的半壁江山甚至更多都吃掉了。
Fig. 2:八个主流vDiT在两款英伟达GPU上的执行时间拆分,自注意力占主导
Fig. 2:八个主流vDiT在两款英伟达GPU上的执行时间拆分,自注意力占主导。
更麻烦的是,视频越长、分辨率越高,token 序列越长,自注意力的代价是平方级增长。论文还给了 roofline 分析,说明这些模型在新一代 GPU 上依然主要是计算受限,不是简单加带宽就能糊过去。
Fig. 3:八个vDiT在两款英伟达GPU上的roofline分析,整体仍以计算瓶颈为主
Fig. 3:八个vDiT在两款英伟达GPU上的roofline分析,整体仍以计算瓶颈为主。
这也是 Kaleido 的切入点:既然注意力已经成了主瓶颈,那就别再照搬大语言模型那套稀疏注意力了。文本 token 可以稀疏,视频 token 可没那么“好欺负”——它们是连续视觉内容,删得太狠,画面就开始抖、开始裂、开始闪,最后像把视频做成了故障艺术。

时空相关性揭秘:注意力模式背后的“通道密码”

Kaleido 的核心观点很有意思:vDiT 的注意力图不是随机长出来的,它背后有稳定的时空相关性。论文把这些模式分成两类:空间模式时间模式
Fig. 5:vDiT注意力图中的空间模式与时间模式
Fig. 5:vDiT注意力图中的空间模式与时间模式。空间模式像重复小格子,时间模式像沿对角线延伸的强相关。
空间模式像一块块重复的“瓷砖”,说明同一帧内部的 token 之间有稳定的空间联系;时间模式则像对角线,说明相邻帧之间的 token 会互相照应。换句话说,视频不是每个 token 都在单打独斗,它们经常是成片、成带、成方向地一起工作。
论文进一步把原因追到位置编码上,特别是 vDiT 常用的 RoPE,英文全称是 Rotary Positional Embedding,中文一般叫“旋转位置编码”。它会把通道按不同方向分组,分别编码时间、水平和垂直信息。论文的 Table 1 还统计了多个模型的通道划分,说明这不是某个模型的偶发现象,而是主流 vDiT 的共同结构。
Table 1:不同vDiT模型的通道划分,分别对应时间、水平和垂直维度
Table 1:不同vDiT模型的通道划分,分别对应时间、水平和垂直维度。
论文做了一个很“硬核但有效”的验证实验:故意只让某一类通道沿某个方向重用,再观察生成质量怎么变。结果很直观——如果让时间通道沿时间方向硬重用,视频更容易出时间扭曲;如果让空间通道沿空间方向重用,容易出现条纹或局部错位。反过来,沿“不是自己负责的方向”重用,伤害反而更小。
Fig. 6:不同通道组与不同方向重用对生成质量的影响
Fig. 6:不同通道组与不同方向重用对生成质量的影响。上半部分是重用方式示意,下半部分是重用后的可视化结果。
Fig. 7:不同方向重用带来的MSE损失对比
Fig. 7:不同方向重用带来的 MSE 损失对比。对某类通道而言,沿另外两个方向重用通常更安全。
这一步的意义很关键:它把“能不能省算力”从拍脑袋猜测,变成了有结构依据的判断。不是简单地砍掉一堆不重要的 token,而是先搞清楚哪一类通道更像在负责哪一种时空关系,再决定哪里可以安全借用前面的计算结果。

通道级重用:让相邻帧“共享”计算,精度损失极小

Kaleido 的算法名里虽然带着“重用”,但它不是粗暴缓存,而是通道级重用。简单说,就是先看相邻 token 在某个方向上有多像,再决定是“完全复用”还是“部分复用”。
Fig. 8:通道级重用算法流程图
Fig. 8:通道级重用算法流程图。算法先算相邻 token 的相似度,再按阈值决定完全重用或部分重用,最后汇总成注意力结果。
这里有两个阈值:θth1θth2。如果相似度特别高,就直接完全重用;如果相似度中等,就只重用高位部分,低位再补算。论文为了让硬件更容易实现,还把阈值设计成 8 位定点下的位级判断:比如前 5 位一致就全重用,前 3 位一致就部分重用。这个设计很工程,也很聪明,因为它把“是否相似”变成了硬件好判断的位运算。
算法流程可以概括成一句话:先判相似,再定重用,最后补齐残差。它不仅用于自注意力,也能扩展到交叉注意力和 MLP 等算子,只是后者更偏向对激活值做重用,而不是对权重做重用。
Fig. 9与Fig. 10:重用方法与跳过方法的MSE对比,以及阈值对提示词的敏感性
Fig. 9 与 Fig. 10:重用方法与跳过方法的 MSE 对比,以及阈值对不同提示词的敏感性。结论是:重用比直接跳过更稳,而且阈值对提示词并不太敏感。
这也是这篇论文最值得点赞的地方之一。很多加速方法一上来就说“省了多少计算”,但一看输出质量,视频已经开始抽风。Kaleido 的重用策略没有走“硬删”的路线,而是尽量保留能共享的部分,把损失压在更低的位置。论文在 HunyuanVideo 上对比了两种跳过式基线,结果显示在相同 token 节省率下,Kaleido 的误差小得多,说明“重用”确实比“直接不算”更适合视频生成。

硬件协同设计:可重构PE与数据调度器,驯服不规则重用

算法省下来的算力,不能只停留在论文图里。Kaleido 直接把硬件也拉进来一起设计,因为这种重用模式对传统加速器并不友好:数据访问不规则、局部稀疏很碎、流水线容易乱套,GPU 上还会碰到 warp divergence 和低利用率。
Fig. 11:Kaleido整体架构,由数据调度器、多个PE阵列和向量单元组成
Fig. 11:Kaleido整体架构,由数据调度器、多个 PE 阵列和向量单元组成。
硬件主体还是经典的 systolic array 风格,但每个 PE 都被重新设计成了可重构处理单元。英文里 PE 是 Processing Element,中文就是“处理单元”。它可以在不同模式下切换,支持不同的数据流,让重用后的结果不用反复在片上内存和计算阵列之间来回搬砖。
Fig. 12与Fig. 13:自注意力重用计算顺序,以及单个PE的结构设计
Fig. 12 与 Fig. 13:自注意力重用计算顺序,以及单个 PE 的结构设计。黄色部分是新增逻辑,说明不是“拿现成阵列硬凑”,而是围绕重用模式做了定制。
除了 PE,另一个关键角色是数据调度器。它负责把重用模式相近的 token 先聚到一起,再把兼容的通道对齐,尽量减少“有数据但不好算”的尴尬。论文给出的示意很形象:同样的数据稀疏度,如果调度得不好,很多 PE 会空转;如果把可合并的输入凑到一起,利用率就能明显上去。
Fig. 15:相同稀疏度下,不同调度方式导致的PE利用率差异
Fig. 15:相同稀疏度下,不同调度方式导致的 PE 利用率差异。左边利用率低,右边通过合并相邻输入显著提升利用率。
Fig. 16:数据调度器设计,由调度器和匹配器组成。调度器先分组,匹配器再配对,目标就是把“能一起算”的东西尽量送到一起。
论文还给出一个面积拆分表,说明这套设计不是“无限堆料”,而是在经典加速器基础上做了可控增强。整体硬件增加的面积开销只有 7.9%,这对一个要真正落地的加速器来说,已经算是比较克制的改造了。
Table 2:Kaleido硬件架构的面积开销拆分
Table 2:Kaleido 硬件架构的面积开销拆分。整体额外面积为 7.9%,属于相对克制的协同设计。

全面超越:5.9倍加速与16倍能效,质量领先17dB

实验部分最能看出这套方案是不是“纸面工程”。Kaleido 在四个主流 vDiT 上做了评估,包括 HunyuanVideo、Wan、CogVideoX 和 TurboDiffusion,并且和 GPU 以及多种近期扩散加速器做了对比。结果很清楚:速度最高提升到 5.9 倍,能效最高提升到 16.0 倍
Fig. 18:Kaleido与现有方法的整体性能对比
Fig. 18:Kaleido 与现有方法的整体性能对比。整体看下来,速度和能效都压过了已有加速器。
更难得的是,论文没有为了跑分把画质牺牲干净。它强调自己的生成质量优于此前方法,文中给出的质量指标差距超过 17 dB。这类数字通常意味着不是“略微好一点”,而是质量保真上确实拉开了差距。对视频生成来说,这一点很重要,因为用户不会因为“快了点”就接受满屏抖动和条纹。
Fig. 17:视频生成质量对比示意,细节上可见Kaleido保持得更稳
Fig. 17:视频生成质量对比示意,细节上可见 Kaleido 保持得更稳。
从实验逻辑看,这组结果也挺合理:前面已经证明了 vDiT 的通道相关性是稳定存在的,重用策略又是按通道和方向精细控制的,所以它比粗暴稀疏更不容易伤到画质;硬件上又有专门的 PE 和调度器兜底,所以算法省下来的东西能真正转化成吞吐和能效,而不是只在理论 FLOPs 里好看。
Fig. 19到Fig. 21:硬件组件消融与PE规模敏感性分析
Fig. 19 到 Fig. 21:硬件组件消融与 PE 规模敏感性分析。可以看出,算法和硬件两边都不是可有可无的配角。
Fig. 22:PE阵列数量与缓冲区大小对性能和能效的影响
Fig. 22:PE 阵列数量与缓冲区大小对性能和能效的影响。说明这套方案对系统配置也有明确的工程权衡。
Fig. 23与Fig. 24:阈值敏感性,以及快动作提示词下的性能与质量对比
Fig. 23 与 Fig. 24:阈值敏感性,以及快动作提示词下的性能与质量对比。阈值可调,但并没有脆到一调就炸。
如果把这篇论文放到更大的语境里看,它其实在回答一个很现实的问题:视频生成模型能不能从“实验室里很能跑”走向“机器上真能用”。Kaleido 的答案是,能,但前提不是简单压缩模型,而是先看懂模型内部到底哪里在重复计算,再把这种重复变成可控的重用路径,最后让硬件跟着这个路径一起跑。
不过它也不是万能钥匙。通道重用依赖于 vDiT 的结构规律和 RoPE 相关性,换到别的生成范式,或者换到相关性明显更弱的场景,收益未必还能这么漂亮。再加上它需要专门硬件支持,离“随便一张卡就能开跑”还有距离。说白了,它更像是一套面向特定模型家族的高效工程方案,而不是通吃一切的通用魔法。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是 vDiT 推理太慢、太费电的问题,尤其是自注意力在长视频和高分辨率场景下成了主瓶颈。Kaleido 的办法不是简单删算力,而是利用潜空间里的时空相关性,把能重用的计算尽量重用起来。

RoPE、通道分组、重用阈值分别是什么意思?RoPE 是旋转位置编码,负责把位置信息写进 token;通道分组是把通道按时间、水平、垂直三个维度切开;重用阈值则是判断两个相邻 token 是否足够像,像到什么程度可以完全复用或部分复用。

为什么它比稀疏注意力更适合视频生成?因为视频 token 不是文本 token,不能随便砍掉一大片不管。稀疏注意力容易破坏连续视觉结构,而 Kaleido 是在保留结构的前提下做局部重用,所以画质损失更小,尤其在动态内容上更稳。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是简单把稀疏注意力换个名字,而是先解释 vDiT 的通道相关性,再做通道级重用和硬件协同,思路完整,创新点也比较扎实。

实验合理度:★★★★☆ 对比了跳过式方法、多个主流模型和硬件配置,实验链条比较闭环;如果再补充更多真实部署场景,可信度还能更强。

学术研究价值:★★★★☆ 它把“视频扩散模型为什么能省算力”这件事讲清楚了,还顺手给了可落地的系统方案,对后续研究很有启发。

稳定性:★★★☆☆ 通道相关性和阈值设计让方法比粗暴稀疏稳,但它仍然依赖特定模型结构和定点实现,离通用稳定还有一步。

适应性以及泛化能力:★★★☆☆ 在多个主流 vDiT 上都能工作,说明不是单模型特化;但换到别的生成架构时,泛化边界还需要验证。

硬件需求及成本:★★★★☆ 额外面积开销 7.9%,算是比较克制;不过它的收益更依赖专门硬件支持,不是随手一贴就能用。

复现难度:★★★☆☆ 算法思路清楚,但真正复现到硬件级别并不轻松,尤其是数据调度和 PE 重构部分。

产品化成熟度:★★★☆☆ 适合面向视频生成加速卡、推理引擎或定制芯片方向落地,但要先补足跨模型、跨负载验证。

可能的问题:方法很强,但更像“为 vDiT 量身定制的高性能手术刀”,不是通用瑞士军刀;离大规模产品化还差部署生态。


主要参考文献

Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng. Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations. arXiv:2601.04194, 2026.
https://arxiv.org/pdf/2601.04194.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!  

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
视频生成太吃算力?来群里聊聊怎么把“看视频”这件事,做成“算视频”。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。