← 返回 PaperDaily 视觉与图像

UT Austin提出ACID:视频生成缓存提速38%,还不怎么掉画质

视频生成最烦的不是“生成不出来”,而是“生成得太慢”。这篇 ACID 直接盯住动态缓存里那个最容易被忽略的点:固定阈值一刀切,天然把速度和画质拴死了。它的思路很朴素,但很有效——该省的时候猛省,该稳的时候别乱抠。

UT Austin提出ACID:视频生成缓存提速38%,还不怎么掉画质
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
视频生成最烦的不是“生成不出来”,而是“生成得太慢”。这篇 ACID 直接盯住动态缓存里那个最容易被忽略的点:固定阈值一刀切,天然把速度和画质拴死了。它的思路很朴素,但很有效——该省的时候猛省,该稳的时候别乱抠。


原论文信息如下:
论文标题:
ACID: Adaptive Caching for vIDeo generation
发表日期:
2026年07月
发表单位:
UT Austin
原文链接:
https://arxiv.org/pdf/2607.12358v1.pdf

视频生成加速的瓶颈:固定阈值缓存的缺陷

视频生成模型最让人抓狂的地方,不是画面不够炫,而是太慢。一个 5 秒左右的视频,单卡 A100 上跑到几分钟并不稀奇。原因也很直白:扩散模型要一步一步去噪,前一步没算完,后一步根本没法开始,天然是“串行工厂流水线”,想并行都难。
于是,缓存加速就成了很自然的思路:既然相邻步的中间特征经常很像,那就别每一步都把完整模型从头算一遍,能复用就复用。TeaCache、EasyCache、DiCache 这类方法,做的就是这件事。它们会先估计当前步“漂移”有多大,如果漂移还没超过阈值,就跳过昂贵的前向计算,直接复用上一步的结果;一旦漂移太大,再把完整模型拉出来重算一次。
问题就出在这个阈值上。固定阈值看起来简单,实际上很“死板”:阈值调高,缓存更激进,速度上去了,画质就容易掉;阈值调低,画质稳了,速度又被拖回去。很多工作把这当成一种“速度和质量不可兼得”的自然规律,但这篇论文的判断很直接:这不是规律,是固定阈值偷懒带来的假象
封面
图1:DiCache 在 Wan 2.1 上的效果示意。自适应阈值把帕累托前沿往外推了,意思很朴素:同样的延迟下,画质更好;或者同样的画质下,速度更快。
ACID 这篇工作真正想解决的,不是“怎么再抠一点缓存率”,而是“缓存该不该一刀切”。答案是否定的。因为扩散去噪并不是均匀平滑地往前走,它中间有些步子特别关键,像下楼梯时某几级台阶最容易踩空;也有些步子很稳定,省一点算力几乎不伤结果。固定阈值的问题就在于,它把“该稳的时候”和“该省的时候”都用同一把尺子量,当然容易顾此失彼。

打破瓶颈:ACID的自适应双阈值策略

ACID 的全称是 Adaptive Caching for vIDeo generation,中文可以理解为“视频生成的自适应缓存”。它的定位非常克制:不是重训模型,不改主干结构,也不依赖复杂额外模块,而是作为一个轻量外壳,直接套在现有动态缓存方法上。
它的核心做法只有一句话:在稳定阶段用高阈值猛缓存,在关键阶段用低阈值保画质。也就是说,阈值不再固定,而是根据当前去噪过程的“状态”动态切换。稳定的时候大胆跳步,波动大的时候老老实实全算。这个思路听起来像“别一根筋”,但恰恰是很多系统优化里最值钱的那种朴素。
更关键的是,ACID 不是只对某一个缓存方法“定制手术”,而是信号无关、模块化的。TeaCache 用的是 TEMNI 相关漂移信号,EasyCache 用的是变换率,DiCache 用的是浅层特征变化;ACID 不关心这些信号具体长什么样,只看它们的变化速度是否进入稳定区。换句话说,它不是去替代原方法,而是在原方法的“缓存决策脑袋”上加了一个更聪明的温控器。
图4:ΔTEMNI 信号在三种模型上的变化
图4:ΔTEMNI 信号在三种模型上的变化。虚线标出了多阈值实验中找到的最佳切换点,说明“什么时候切阈值”不是拍脑袋,而是可以从信号走势里看出来的。
从工程角度看,这种设计很讨喜:它不需要重新训练,也不会把部署链路搞得更复杂。动态缓存本来就已经在跑,ACID 只是决定“这一小段该用松一点的阈值,还是紧一点的阈值”。对实际系统来说,这类改动往往比“重做一套大模型”更有落地价值,因为它更像在现有流水线上加了一个更聪明的调度器。

原理揭秘:从信号二阶导数识别“关键步骤”

这篇论文最有意思的地方,不是“又搞了一个阈值”,而是它先问了一个很工程的问题:到底什么时候该切换阈值?答案不是经验主义,而是看缓存信号的变化率,尤其是二阶变化是否进入稳定区。
先把基础概念说人话。扩散模型在推理时,是从随机噪声一步步“洗干净”成视频。训练时会不断往样本里加噪,形成一个正向扩散过程;推理时则要反过来,从噪声里把内容一点点抠出来。论文里给了两个基础公式,分别描述这两个过程。
公式1:正向扩散过程。这里的 xt 表示第 t 步的样本,αt 控制噪声比例,zt 是高斯噪声。直白点说,就是“每一步都往图像里再糊一点噪声”。
公式2:反向去噪分布。pθ(xt-1|xt) 表示在当前噪声状态 xt 下,模型预测下一步 xt-1 的分布。μθ 和 Σθ 是模型学出来的均值和方差,负责把噪声往“像视频”的方向拉回去。
ACID 的关键观察是:去噪过程里并不是每一步都同等重要。论文通过分析 TeaCache 的 ΔTEMNI 信号发现,很多 prompt 下这个信号的结构相当一致,但不同模型的整体形状又不一样。HunyuanVideo 和 Wan 2.1 常见的是 U 型变化,CogVideoX 则明显不同。也就是说,缓存信号不是乱跳,而是带结构的,只是这个结构会随模型变。
图2和图3:不同 prompt 与不同模型下的缓存信号分析
图2和图3:不同 prompt 下缓存信号的一致性,以及不同模型下缓存信号的结构模式。结论很明确:信号有规律,但规律不是一刀切的。
接着论文做了一个很聪明的小实验:不是只看单一阈值,而是尝试在去噪过程中间切换低阈值和高阈值,看看什么时候切换,才能同时兼顾速度和质量。结果发现,最优切换点并不是随机出现的,而是和 ΔTEMNI 的二阶导数趋于稳定的位置高度一致。换成人话就是:当“信号变化得没那么剧烈了”,就可以放宽阈值,开始更激进地缓存;反过来,一旦变化又开始剧烈,就得收紧阈值,别乱省算力。
图5:ΔTEMNI 信号的二阶导数
图5:ΔTEMNI 信号的二阶导数。虚线标出的切换点和“二阶导数稳定下来”的位置对上了,这就是 ACID 选择用变化率来切阈值的依据。
于是,ACID 的逻辑就很清楚了:先用原缓存方法自己的信号判断当前是否进入稳定区,再根据这个判断切换阈值。稳定区用 τhigh,允许更多步被缓存;动态区用 τlow,减少缓存、保住质量。它本质上不是在“发明新缓存信号”,而是在原信号之上加了一个“什么时候该保守、什么时候该大胆”的判别器。
如果把这件事再说得更通俗一点:原来的固定阈值像一个只会说“省”或者“别省”的保安;ACID 更像一个看场面的老手,知道演出高潮时不能乱省电,灯光稳定时可以放心降功耗。这个差别不花哨,但很实用。🙂

实战验证:三大模型与缓存方法全面超越

实验部分的设计很务实:直接把 ACID 套到三种开源视频扩散模型上,再分别挂到三种动态缓存方法上,看它是不是“真有用”,而不是只在单一设置里好看。模型包括 HunyuanVideo、Wan 2.1 和 CogVideoX 1.5,缓存方法包括 TeaCache、EasyCache 和 DiCache。评估指标也很朴素,既看速度,也看质量:延迟、加速比、PSNR、SSIM、LPIPS。
这种实验设置有个好处:它不是只证明“某个方法在某个模型上能跑”,而是尽量验证 ACID 的可迁移性。因为如果一个缓存策略只能在一个模型上灵,换个模型就翻车,那工程价值会立刻打折。
表1:各方法在不同视频生成模型上的量化结果
表1:各方法在不同视频生成模型上的量化结果。可以看到,ACID 基本都把结果推到了固定阈值方法之外:速度更快,画质又没有明显塌下去。
先看 TeaCache。HunyuanVideo 上,ACID 达到 2.16× 加速,比保守固定阈值更快,但画质基本贴着低阈值版本走;Wan 2.1 上也是类似逻辑,ACID 在速度和质量之间拿到了更均衡的位置;CogVideoX 上同样成立。更重要的是,ACID 不是“比低阈值差一点、比高阈值好一点”这种中庸式妥协,而是把固定阈值的帕累托前沿往外推了一截。
图6:TeaCache 的帕累托前沿
图6:TeaCache 的帕累托前沿。彩色点代表 ACID,灰色点代表固定阈值配置。彩色点整体向外扩,说明自适应阈值不是“换个说法”,而是真的把可达区域往外推了。
EasyCache 的结果也挺有意思。它本身就会在开始几步直接全算,所以已经隐含了“前期保守、后期放开”的味道。ACID 在这个基础上进一步做自适应切换后,HunyuanVideo 和 Wan 2.1 上都能继续把速度和质量往更优的位置挪。这里最值得注意的是:即便缓存信号完全不同,ACID 仍然有效,这说明它不是某个特定信号的偶然红利,而是对“固定阈值过于僵硬”这个结构性问题的修补。
图7:EasyCache 的帕累托前沿
图7:EasyCache 的帕累托前沿。ACID 继续把固定阈值边界推开,说明这个思路不挑“缓存信号门派”。
DiCache 也给出了类似结论。它本来是靠浅层特征来估计漂移,信号更偏“特征级”。ACID 套上去之后,HunyuanVideo 和 Wan 2.1 上都能获得更优的速度-质量折中。尤其是在 Wan 2.1 上,ACID 的加速比比低阈值版本更高,画质却没有掉到高阈值那种“肉眼可见的松垮”状态。
图8:DiCache 的帕累托前沿
图8:DiCache 的帕累托前沿。结论和前两组一致:ACID 把“固定阈值只能二选一”的老毛病,改成了“该冲就冲,该稳就稳”。
如果只看数字,ACID 最亮眼的地方是:在 TeaCache + HunyuanVideo 上,最高能拿到 2.16× 的整体加速,并且相对保守固定阈值还能再多出约 38% 的速度提升,画质损失却非常小,PSNR、SSIM、LPIPS 的变化都很克制。这个结果的意思不是“画质完全零损失”,而是“在可接受的视觉差异内,换到了更高吞吐”。这在视频生成这种本来就慢得离谱的任务里,已经很有现实意义了。

总结与展望

ACID 的价值,不在于它发明了某种神秘新机制,而在于它把一个被大家默认接受的“固定阈值 trade-off”,拆开重新看了一遍。结果发现,很多时候并不是速度和质量天然冲突,而是缓存策略太粗糙,没把去噪过程里的“关键步骤”识别出来。
从落地角度看,这类方法很有吸引力:不重训、可插拔、计算开销低,适合直接接到现有视频生成推理链路里。它的边界也很明确:ACID 依赖已有缓存方法的信号质量,如果底层信号本身不稳定,或者模型行为在新场景下发生明显漂移,阈值切换就可能没那么理想。另外,它目前主要验证的是开源视频扩散模型,离大规模在线产品的稳定部署还差一层更严格的系统验证。
但这并不妨碍它给工程实践一个很好的启发:别总想着把一个阈值调到宇宙最优,先想想它是不是应该随时间变。很多系统优化的真正收益,不在于把某个局部指标抠到极致,而在于把“什么时候该保守、什么时候该激进”这件事做对。ACID 就是这样一个不花哨、但很实在的例子。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是视频生成里“缓存加速和画质保持很难兼得”的问题。论文认为,真正的症结不是缓存本身,而是动态缓存方法长期使用固定阈值,导致该稳的时候省过头、该省的时候又不够大胆。

ACID 里的“双阈值”是什么意思?就是两个阈值轮流上场:τlow 用在变化剧烈、质量更敏感的阶段;τhigh 用在稳定阶段,允许更多缓存。切换依据不是拍脑袋,而是缓存信号变化是否进入稳定区。

为什么要看二阶导数,而不是只看当前信号大小?因为“信号大不大”只能告诉当前波动是否明显,但“变化速度有没有稳定下来”更能指示什么时候进入可放心缓存的阶段。二阶变化稳定,往往意味着去噪过程已经从剧烈调整进入相对平稳区,这时切到高阈值更合适。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

创新点不在“新模型”本身,而在于把固定阈值这个老问题拆穿了,并给出一个可插拔的自适应方案。思路不算花哨,但打得很准。

实验合理度:★★★★☆

跨三种模型、三种缓存方法验证,覆盖面不错,而且专门用固定阈值的多个配置做对照,能说明问题不是偶然。

学术研究价值:★★★★☆

它指出了动态缓存里一个很普遍的结构性缺陷,对后续做推理加速、调度策略、动态阈值设计都有启发。

稳定性:★★★☆☆

方法本身轻量,但仍依赖底层缓存信号质量。换模型、换场景后,阈值切换是否依旧稳定,还需要更多验证。

适应性以及泛化能力:★★★★☆

能跨 TeaCache、EasyCache、DiCache 和三种视频模型工作,泛化性已经不错;但仍属于视频扩散缓存这一类任务内的泛化。

硬件需求及成本:★★★★★

几乎不增加训练成本,推理侧开销也很低,属于很典型的“拿一点判断换很多算力”的方法。

复现难度:★★★☆☆

思路不复杂,但要完整复现多模型、多缓存方法、多阈值配置,工程量不算小;好在方法本身不需要重训。

产品化成熟度:★★★☆☆

适合接入现有视频生成推理系统做加速优化,但还需要更大规模、更多场景的稳定性验证,尤其是长视频和复杂 prompt。

可能的问题:方法依赖缓存信号稳定性,阈值切换规则仍偏经验化;跨更多模型和更复杂视频任务时,收益是否一致还需进一步验证。


主要参考文献

Om Agrawal, Saurabh Agarwal, Aditya Akella. ACID: Adaptive Caching for vIDeo generation. arXiv preprint, 2026.
TeaCache, EasyCache, DiCache 及相关视频扩散加速工作见论文参考文献列表。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
视频生成、扩散模型、推理加速这些方向的同学,群里讨论很对味,少走很多弯路。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。