← 返回 PaperDaily
视觉与图像
UT Austin提出ACID:视频生成缓存提速38%,还不怎么掉画质
视频生成最烦的不是“生成不出来”,而是“生成得太慢”。这篇 ACID 直接盯住动态缓存里那个最容易被忽略的点:固定阈值一刀切,天然把速度和画质拴死了。它的思路很朴素,但很有效——该省的时候猛省,该稳的时候别乱抠。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
视频生成最烦的不是“生成不出来”,而是“生成得太慢”。这篇 ACID 直接盯住动态缓存里那个最容易被忽略的点:固定阈值一刀切,天然把速度和画质拴死了。它的思路很朴素,但很有效——该省的时候猛省,该稳的时候别乱抠。
原论文信息如下:
视频生成加速的瓶颈:固定阈值缓存的缺陷
视频生成模型最让人抓狂的地方,不是画面不够炫,而是太慢。一个 5 秒左右的视频,单卡 A100 上跑到几分钟并不稀奇。原因也很直白:扩散模型要一步一步去噪,前一步没算完,后一步根本没法开始,天然是“串行工厂流水线”,想并行都难。
于是,缓存加速就成了很自然的思路:既然相邻步的中间特征经常很像,那就别每一步都把完整模型从头算一遍,能复用就复用。TeaCache、EasyCache、DiCache 这类方法,做的就是这件事。它们会先估计当前步“漂移”有多大,如果漂移还没超过阈值,就跳过昂贵的前向计算,直接复用上一步的结果;一旦漂移太大,再把完整模型拉出来重算一次。
问题就出在这个阈值上。固定阈值看起来简单,实际上很“死板”:阈值调高,缓存更激进,速度上去了,画质就容易掉;阈值调低,画质稳了,速度又被拖回去。很多工作把这当成一种“速度和质量不可兼得”的自然规律,但这篇论文的判断很直接:这不是规律,是固定阈值偷懒带来的假象。
ACID 这篇工作真正想解决的,不是“怎么再抠一点缓存率”,而是“缓存该不该一刀切”。答案是否定的。因为扩散去噪并不是均匀平滑地往前走,它中间有些步子特别关键,像下楼梯时某几级台阶最容易踩空;也有些步子很稳定,省一点算力几乎不伤结果。固定阈值的问题就在于,它把“该稳的时候”和“该省的时候”都用同一把尺子量,当然容易顾此失彼。
打破瓶颈:ACID的自适应双阈值策略
ACID 的全称是 Adaptive Caching for vIDeo generation,中文可以理解为“视频生成的自适应缓存”。它的定位非常克制:不是重训模型,不改主干结构,也不依赖复杂额外模块,而是作为一个轻量外壳,直接套在现有动态缓存方法上。
它的核心做法只有一句话:在稳定阶段用高阈值猛缓存,在关键阶段用低阈值保画质。也就是说,阈值不再固定,而是根据当前去噪过程的“状态”动态切换。稳定的时候大胆跳步,波动大的时候老老实实全算。这个思路听起来像“别一根筋”,但恰恰是很多系统优化里最值钱的那种朴素。
更关键的是,ACID 不是只对某一个缓存方法“定制手术”,而是信号无关、模块化的。TeaCache 用的是 TEMNI 相关漂移信号,EasyCache 用的是变换率,DiCache 用的是浅层特征变化;ACID 不关心这些信号具体长什么样,只看它们的变化速度是否进入稳定区。换句话说,它不是去替代原方法,而是在原方法的“缓存决策脑袋”上加了一个更聪明的温控器。
从工程角度看,这种设计很讨喜:它不需要重新训练,也不会把部署链路搞得更复杂。动态缓存本来就已经在跑,ACID 只是决定“这一小段该用松一点的阈值,还是紧一点的阈值”。对实际系统来说,这类改动往往比“重做一套大模型”更有落地价值,因为它更像在现有流水线上加了一个更聪明的调度器。
原理揭秘:从信号二阶导数识别“关键步骤”
这篇论文最有意思的地方,不是“又搞了一个阈值”,而是它先问了一个很工程的问题:到底什么时候该切换阈值?答案不是经验主义,而是看缓存信号的变化率,尤其是二阶变化是否进入稳定区。
先把基础概念说人话。扩散模型在推理时,是从随机噪声一步步“洗干净”成视频。训练时会不断往样本里加噪,形成一个正向扩散过程;推理时则要反过来,从噪声里把内容一点点抠出来。论文里给了两个基础公式,分别描述这两个过程。
公式1:正向扩散过程。这里的 xt 表示第 t 步的样本,αt 控制噪声比例,zt 是高斯噪声。直白点说,就是“每一步都往图像里再糊一点噪声”。
公式2:反向去噪分布。pθ(xt-1|xt) 表示在当前噪声状态 xt 下,模型预测下一步 xt-1 的分布。μθ 和 Σθ 是模型学出来的均值和方差,负责把噪声往“像视频”的方向拉回去。
ACID 的关键观察是:去噪过程里并不是每一步都同等重要。论文通过分析 TeaCache 的 ΔTEMNI 信号发现,很多 prompt 下这个信号的结构相当一致,但不同模型的整体形状又不一样。HunyuanVideo 和 Wan 2.1 常见的是 U 型变化,CogVideoX 则明显不同。也就是说,缓存信号不是乱跳,而是带结构的,只是这个结构会随模型变。
接着论文做了一个很聪明的小实验:不是只看单一阈值,而是尝试在去噪过程中间切换低阈值和高阈值,看看什么时候切换,才能同时兼顾速度和质量。结果发现,最优切换点并不是随机出现的,而是和 ΔTEMNI 的二阶导数趋于稳定的位置高度一致。换成人话就是:当“信号变化得没那么剧烈了”,就可以放宽阈值,开始更激进地缓存;反过来,一旦变化又开始剧烈,就得收紧阈值,别乱省算力。
于是,ACID 的逻辑就很清楚了:先用原缓存方法自己的信号判断当前是否进入稳定区,再根据这个判断切换阈值。稳定区用 τhigh,允许更多步被缓存;动态区用 τlow,减少缓存、保住质量。它本质上不是在“发明新缓存信号”,而是在原信号之上加了一个“什么时候该保守、什么时候该大胆”的判别器。
如果把这件事再说得更通俗一点:原来的固定阈值像一个只会说“省”或者“别省”的保安;ACID 更像一个看场面的老手,知道演出高潮时不能乱省电,灯光稳定时可以放心降功耗。这个差别不花哨,但很实用。🙂
实战验证:三大模型与缓存方法全面超越
实验部分的设计很务实:直接把 ACID 套到三种开源视频扩散模型上,再分别挂到三种动态缓存方法上,看它是不是“真有用”,而不是只在单一设置里好看。模型包括 HunyuanVideo、Wan 2.1 和 CogVideoX 1.5,缓存方法包括 TeaCache、EasyCache 和 DiCache。评估指标也很朴素,既看速度,也看质量:延迟、加速比、PSNR、SSIM、LPIPS。
这种实验设置有个好处:它不是只证明“某个方法在某个模型上能跑”,而是尽量验证 ACID 的可迁移性。因为如果一个缓存策略只能在一个模型上灵,换个模型就翻车,那工程价值会立刻打折。
先看 TeaCache。HunyuanVideo 上,ACID 达到 2.16× 加速,比保守固定阈值更快,但画质基本贴着低阈值版本走;Wan 2.1 上也是类似逻辑,ACID 在速度和质量之间拿到了更均衡的位置;CogVideoX 上同样成立。更重要的是,ACID 不是“比低阈值差一点、比高阈值好一点”这种中庸式妥协,而是把固定阈值的帕累托前沿往外推了一截。
EasyCache 的结果也挺有意思。它本身就会在开始几步直接全算,所以已经隐含了“前期保守、后期放开”的味道。ACID 在这个基础上进一步做自适应切换后,HunyuanVideo 和 Wan 2.1 上都能继续把速度和质量往更优的位置挪。这里最值得注意的是:即便缓存信号完全不同,ACID 仍然有效,这说明它不是某个特定信号的偶然红利,而是对“固定阈值过于僵硬”这个结构性问题的修补。
DiCache 也给出了类似结论。它本来是靠浅层特征来估计漂移,信号更偏“特征级”。ACID 套上去之后,HunyuanVideo 和 Wan 2.1 上都能获得更优的速度-质量折中。尤其是在 Wan 2.1 上,ACID 的加速比比低阈值版本更高,画质却没有掉到高阈值那种“肉眼可见的松垮”状态。
如果只看数字,ACID 最亮眼的地方是:在 TeaCache + HunyuanVideo 上,最高能拿到 2.16× 的整体加速,并且相对保守固定阈值还能再多出约 38% 的速度提升,画质损失却非常小,PSNR、SSIM、LPIPS 的变化都很克制。这个结果的意思不是“画质完全零损失”,而是“在可接受的视觉差异内,换到了更高吞吐”。这在视频生成这种本来就慢得离谱的任务里,已经很有现实意义了。
总结与展望
ACID 的价值,不在于它发明了某种神秘新机制,而在于它把一个被大家默认接受的“固定阈值 trade-off”,拆开重新看了一遍。结果发现,很多时候并不是速度和质量天然冲突,而是缓存策略太粗糙,没把去噪过程里的“关键步骤”识别出来。
从落地角度看,这类方法很有吸引力:不重训、可插拔、计算开销低,适合直接接到现有视频生成推理链路里。它的边界也很明确:ACID 依赖已有缓存方法的信号质量,如果底层信号本身不稳定,或者模型行为在新场景下发生明显漂移,阈值切换就可能没那么理想。另外,它目前主要验证的是开源视频扩散模型,离大规模在线产品的稳定部署还差一层更严格的系统验证。
但这并不妨碍它给工程实践一个很好的启发:别总想着把一个阈值调到宇宙最优,先想想它是不是应该随时间变。很多系统优化的真正收益,不在于把某个局部指标抠到极致,而在于把“什么时候该保守、什么时候该激进”这件事做对。ACID 就是这样一个不花哨、但很实在的例子。
龙迷三问
这篇论文到底解决了什么问题?它解决的是视频生成里“缓存加速和画质保持很难兼得”的问题。论文认为,真正的症结不是缓存本身,而是动态缓存方法长期使用固定阈值,导致该稳的时候省过头、该省的时候又不够大胆。
ACID 里的“双阈值”是什么意思?就是两个阈值轮流上场:τlow 用在变化剧烈、质量更敏感的阶段;τhigh 用在稳定阶段,允许更多缓存。切换依据不是拍脑袋,而是缓存信号变化是否进入稳定区。
为什么要看二阶导数,而不是只看当前信号大小?因为“信号大不大”只能告诉当前波动是否明显,但“变化速度有没有稳定下来”更能指示什么时候进入可放心缓存的阶段。二阶变化稳定,往往意味着去噪过程已经从剧烈调整进入相对平稳区,这时切到高阈值更合适。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
创新点不在“新模型”本身,而在于把固定阈值这个老问题拆穿了,并给出一个可插拔的自适应方案。思路不算花哨,但打得很准。
实验合理度:★★★★☆
跨三种模型、三种缓存方法验证,覆盖面不错,而且专门用固定阈值的多个配置做对照,能说明问题不是偶然。
学术研究价值:★★★★☆
它指出了动态缓存里一个很普遍的结构性缺陷,对后续做推理加速、调度策略、动态阈值设计都有启发。
稳定性:★★★☆☆
方法本身轻量,但仍依赖底层缓存信号质量。换模型、换场景后,阈值切换是否依旧稳定,还需要更多验证。
适应性以及泛化能力:★★★★☆
能跨 TeaCache、EasyCache、DiCache 和三种视频模型工作,泛化性已经不错;但仍属于视频扩散缓存这一类任务内的泛化。
硬件需求及成本:★★★★★
几乎不增加训练成本,推理侧开销也很低,属于很典型的“拿一点判断换很多算力”的方法。
复现难度:★★★☆☆
思路不复杂,但要完整复现多模型、多缓存方法、多阈值配置,工程量不算小;好在方法本身不需要重训。
产品化成熟度:★★★☆☆
适合接入现有视频生成推理系统做加速优化,但还需要更大规模、更多场景的稳定性验证,尤其是长视频和复杂 prompt。
可能的问题:方法依赖缓存信号稳定性,阈值切换规则仍偏经验化;跨更多模型和更复杂视频任务时,收益是否一致还需进一步验证。
主要参考文献
Om Agrawal, Saurabh Agarwal, Aditya Akella. ACID: Adaptive Caching for vIDeo generation. arXiv preprint, 2026.
TeaCache, EasyCache, DiCache 及相关视频扩散加速工作见论文参考文献列表。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
视频生成、扩散模型、推理加速这些方向的同学,群里讨论很对味,少走很多弯路。

