← 返回 PaperDaily
视觉与图像
上交大华为联手:vDiT重用计算省16倍能效
视频扩散Transformer最烦的不是“能不能生成”,而是“生成一段视频到底要烧掉多少算力”。Kaleido不跟稀疏注意力硬卷,而是从潜空间通道相关性下手,顺手把算法和硬件一起改了,思路很工程,也很狠。
龙哥读论文
发布于 2026-08-26 00:20:05
阅读 5
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 视频扩散Transformer最烦的不是“能不能生成”,而是“生成一段视频到底要烧掉多少算力”。Kaleido不跟稀疏注意力硬卷,而是从潜空间通道相关性下手,顺手把算法和硬件一起改了,思路很工程,也很狠。
原论文信息如下:
视频生成新瓶颈:注意力计算如何“吃光”算力?
视频扩散模型最让工程师头疼的地方,不是“能不能生成”,而是“生成一段像样的视频到底要烧掉多少算力”。这篇论文盯住的就是这个现实问题:视频扩散Transformer ,简称 vDiT ,英文全称是 video diffusion transformer ,中文就是“视频扩散Transformer”。它的工作方式并不神秘:先把噪声视频压到潜空间,再在多个去噪步里一遍遍预测噪声,最后再解码回视频。
问题在于,早期大家总盯着“去噪步数太多”这个瓶颈,结果近年的蒸馏、缓存等方法把步数压下去了,新的老大难就浮出水面了:自注意力 。论文统计了八个主流 vDiT 的执行时间,结论很直接:自注意力几乎把总时间的半壁江山甚至更多都吃掉了。
更麻烦的是,视频越长、分辨率越高,token 序列越长,自注意力的代价是平方级增长。论文还给了 roofline 分析,说明这些模型在新一代 GPU 上依然主要是计算受限 ,不是简单加带宽就能糊过去。
这也是 Kaleido 的切入点:既然注意力已经成了主瓶颈,那就别再照搬大语言模型那套稀疏注意力了。文本 token 可以稀疏,视频 token 可没那么“好欺负”——它们是连续视觉内容,删得太狠,画面就开始抖、开始裂、开始闪,最后像把视频做成了故障艺术。
时空相关性揭秘:注意力模式背后的“通道密码”
Kaleido 的核心观点很有意思:vDiT 的注意力图不是随机长出来的,它背后有稳定的时空相关性 。论文把这些模式分成两类:空间模式 和时间模式 。
空间模式像一块块重复的“瓷砖”,说明同一帧内部的 token 之间有稳定的空间联系;时间模式则像对角线,说明相邻帧之间的 token 会互相照应。换句话说,视频不是每个 token 都在单打独斗,它们经常是成片、成带、成方向地一起工作。
论文进一步把原因追到位置编码上,特别是 vDiT 常用的 RoPE ,英文全称是 Rotary Positional Embedding ,中文一般叫“旋转位置编码”。它会把通道按不同方向分组,分别编码时间、水平和垂直信息。论文的 Table 1 还统计了多个模型的通道划分,说明这不是某个模型的偶发现象,而是主流 vDiT 的共同结构。
论文做了一个很“硬核但有效”的验证实验:故意只让某一类通道沿某个方向重用,再观察生成质量怎么变。结果很直观——如果让时间通道沿时间方向硬重用,视频更容易出时间扭曲;如果让空间通道沿空间方向重用,容易出现条纹或局部错位。反过来,沿“不是自己负责的方向”重用,伤害反而更小。
这一步的意义很关键:它把“能不能省算力”从拍脑袋猜测,变成了有结构依据的判断。不是简单地砍掉一堆不重要的 token,而是先搞清楚哪一类通道更像在负责哪一种时空关系,再决定哪里可以安全借用前面的计算结果。
通道级重用:让相邻帧“共享”计算,精度损失极小
Kaleido 的算法名里虽然带着“重用”,但它不是粗暴缓存,而是通道级重用 。简单说,就是先看相邻 token 在某个方向上有多像,再决定是“完全复用”还是“部分复用”。
这里有两个阈值:θth1 和 θth2 。如果相似度特别高,就直接完全重用;如果相似度中等,就只重用高位部分,低位再补算。论文为了让硬件更容易实现,还把阈值设计成 8 位定点下的位级判断:比如前 5 位一致就全重用,前 3 位一致就部分重用。这个设计很工程,也很聪明,因为它把“是否相似”变成了硬件好判断的位运算。
算法流程可以概括成一句话:先判相似,再定重用,最后补齐残差 。它不仅用于自注意力,也能扩展到交叉注意力和 MLP 等算子,只是后者更偏向对激活值做重用,而不是对权重做重用。
这也是这篇论文最值得点赞的地方之一。很多加速方法一上来就说“省了多少计算”,但一看输出质量,视频已经开始抽风。Kaleido 的重用策略没有走“硬删”的路线,而是尽量保留能共享的部分,把损失压在更低的位置。论文在 HunyuanVideo 上对比了两种跳过式基线,结果显示在相同 token 节省率下,Kaleido 的误差小得多,说明“重用”确实比“直接不算”更适合视频生成。
硬件协同设计:可重构PE与数据调度器,驯服不规则重用
算法省下来的算力,不能只停留在论文图里。Kaleido 直接把硬件也拉进来一起设计,因为这种重用模式对传统加速器并不友好:数据访问不规则、局部稀疏很碎、流水线容易乱套,GPU 上还会碰到 warp divergence 和低利用率。
硬件主体还是经典的 systolic array 风格,但每个 PE 都被重新设计成了可重构处理单元 。英文里 PE 是 Processing Element ,中文就是“处理单元”。它可以在不同模式下切换,支持不同的数据流,让重用后的结果不用反复在片上内存和计算阵列之间来回搬砖。
除了 PE,另一个关键角色是数据调度器 。它负责把重用模式相近的 token 先聚到一起,再把兼容的通道对齐,尽量减少“有数据但不好算”的尴尬。论文给出的示意很形象:同样的数据稀疏度,如果调度得不好,很多 PE 会空转;如果把可合并的输入凑到一起,利用率就能明显上去。
Fig. 16:数据调度器设计,由调度器和匹配器组成。调度器先分组,匹配器再配对,目标就是把“能一起算”的东西尽量送到一起。
论文还给出一个面积拆分表,说明这套设计不是“无限堆料”,而是在经典加速器基础上做了可控增强。整体硬件增加的面积开销只有 7.9%,这对一个要真正落地的加速器来说,已经算是比较克制的改造了。
全面超越:5.9倍加速与16倍能效,质量领先17dB
实验部分最能看出这套方案是不是“纸面工程”。Kaleido 在四个主流 vDiT 上做了评估,包括 HunyuanVideo、Wan、CogVideoX 和 TurboDiffusion,并且和 GPU 以及多种近期扩散加速器做了对比。结果很清楚:速度最高提升到 5.9 倍 ,能效最高提升到 16.0 倍 。
更难得的是,论文没有为了跑分把画质牺牲干净。它强调自己的生成质量优于此前方法,文中给出的质量指标差距超过 17 dB 。这类数字通常意味着不是“略微好一点”,而是质量保真上确实拉开了差距。对视频生成来说,这一点很重要,因为用户不会因为“快了点”就接受满屏抖动和条纹。
从实验逻辑看,这组结果也挺合理:前面已经证明了 vDiT 的通道相关性是稳定存在的,重用策略又是按通道和方向精细控制的,所以它比粗暴稀疏更不容易伤到画质;硬件上又有专门的 PE 和调度器兜底,所以算法省下来的东西能真正转化成吞吐和能效,而不是只在理论 FLOPs 里好看。
如果把这篇论文放到更大的语境里看,它其实在回答一个很现实的问题:视频生成模型能不能从“实验室里很能跑”走向“机器上真能用”。Kaleido 的答案是,能,但前提不是简单压缩模型,而是先看懂模型内部到底哪里在重复计算,再把这种重复变成可控的重用路径,最后让硬件跟着这个路径一起跑。
不过它也不是万能钥匙。通道重用依赖于 vDiT 的结构规律和 RoPE 相关性,换到别的生成范式,或者换到相关性明显更弱的场景,收益未必还能这么漂亮。再加上它需要专门硬件支持,离“随便一张卡就能开跑”还有距离。说白了,它更像是一套面向特定模型家族的高效工程方案 ,而不是通吃一切的通用魔法。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是 vDiT 推理太慢、太费电的问题,尤其是自注意力在长视频和高分辨率场景下成了主瓶颈。Kaleido 的办法不是简单删算力,而是利用潜空间里的时空相关性,把能重用的计算尽量重用起来。
RoPE、通道分组、重用阈值分别是什么意思? RoPE 是旋转位置编码,负责把位置信息写进 token;通道分组是把通道按时间、水平、垂直三个维度切开;重用阈值则是判断两个相邻 token 是否足够像,像到什么程度可以完全复用或部分复用。
为什么它比稀疏注意力更适合视频生成? 因为视频 token 不是文本 token,不能随便砍掉一大片不管。稀疏注意力容易破坏连续视觉结构,而 Kaleido 是在保留结构的前提下做局部重用,所以画质损失更小,尤其在动态内容上更稳。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 不是简单把稀疏注意力换个名字,而是先解释 vDiT 的通道相关性,再做通道级重用和硬件协同,思路完整,创新点也比较扎实。
实验合理度: ★★★★☆ 对比了跳过式方法、多个主流模型和硬件配置,实验链条比较闭环;如果再补充更多真实部署场景,可信度还能更强。
学术研究价值: ★★★★☆ 它把“视频扩散模型为什么能省算力”这件事讲清楚了,还顺手给了可落地的系统方案,对后续研究很有启发。
稳定性: ★★★☆☆ 通道相关性和阈值设计让方法比粗暴稀疏稳,但它仍然依赖特定模型结构和定点实现,离通用稳定还有一步。
适应性以及泛化能力: ★★★☆☆ 在多个主流 vDiT 上都能工作,说明不是单模型特化;但换到别的生成架构时,泛化边界还需要验证。
硬件需求及成本: ★★★★☆ 额外面积开销 7.9%,算是比较克制;不过它的收益更依赖专门硬件支持,不是随手一贴就能用。
复现难度: ★★★☆☆ 算法思路清楚,但真正复现到硬件级别并不轻松,尤其是数据调度和 PE 重构部分。
产品化成熟度: ★★★☆☆ 适合面向视频生成加速卡、推理引擎或定制芯片方向落地,但要先补足跨模型、跨负载验证。
可能的问题: 方法很强,但更像“为 vDiT 量身定制的高性能手术刀”,不是通用瑞士军刀;离大规模产品化还差部署生态。
主要参考文献
Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng. Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations. arXiv:2601.04194, 2026.
https://arxiv.org/pdf/2601.04194.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!