← 返回 PaperDaily 视觉与图像

告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准

继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生

告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准
🐉 龙哥读论文知识星球来了!
想第一时间拿到PRISM这种“零解码”奖励模型的源码和更多SOTA思路?公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生成对齐的龙迷细品。


原论文信息如下:
论文标题:
Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models
发表日期:
2026年06月
发表单位:
香港城市大学
原文链接:
https://arxiv.org/pdf/2606.20310v1.pdf
开源代码链接:
暂无
封面图:PRISM BoN定性对比结果
图:PRISM(左)与基于像素的奖励模型(右)在相同提示下的对比。PRISM选出的样本在语义保真度和物理一致性上明显更优。
大家好,我是龙哥。今天咱们来聊一篇视频生成对齐方向的最新力作——来自香港城市大学的PRISM。这名字乍一听像是某种棱镜原理,其实是"Preference Representation in Intermediate States of Video Diffusion Models"的缩写,翻译过来就是“视频扩散模型中间状态下的偏好表征”。说白了,就是让视频生成模型自己在生成过程中“当场打分”,不需要等到视频全生成完再叫一个外部大模型来评价——省时省力还更准。

1. 告别像素域:PRISM如何从噪声中解码偏好?

先打个比方:传统视频奖励模型(VRM,Video Reward Model)就像请一位顶级美食家来品菜——他得等菜做好、装盘、端上桌,尝一口才能给出评价。而PRISM的思路是:让做菜的厨师本人,在炒菜过程中就判断味道好不好——甚至还在锅里冒着烟的时候就能说“这菜有戏”或“翻车了,重新来”。为什么厨师能行?因为他见过的菜够多,炒每一个步骤时就已经知道成品大概什么样。
PRISM的核心洞察在于:一个经过充分预训练的视频扩散模型(比如Wan2.1或CogVideoX),其内部早已建立了一个丰富的“视频流形先验”——它知道什么样的视频是自然的、什么样的扭曲是异常。哪怕输入是一堆噪声(高噪态latent),模型内部的神经元仍然保留着对清晰结构的“记忆”。基于这一灵感,PRISM干脆把整个扩散主干冻住(freeze),在上面加一个极其轻量的查询聚合头(Query-based Aggregation head),直接从噪声潜伏空间里提取偏好信号。
这样做的好处是显而易见的:
零VAE解码开销:传统方法需要把每个候选视频从latent解码到像素域(VAE decode),再送入大视觉语言模型(VLM)评价,这一步极其耗时(以秒计)。PRISM直接在latent里打分,省掉了全部解码。
天然抗噪:外部VLM面对高噪图直接懵圈——它只见过清晰图片,完全无法理解一团马赛克。而PRISM从扩散模型内部提取特征,这些特征本身就是为不同噪态设计的,所以无论噪声多严重都能稳定输出偏好分数。
下图直观反映了PRISM与传统像素级奖励模型的本质区别:
图1:PRISM框架与传统像素级奖励模型的对比。PRISM直接对带噪潜变量zt、提示c和时间步t进行评分,避免了完整的去噪和VAE解码流程。
图1:PRISM框架与传统像素级奖励模型的对比。PRISM直接对带噪潜变量z_t、提示c和时间步t进行评分,而传统方法需先完整去噪得到x_0,再VAE解码到像素域,最后用外部VLM评估——流程冗长且无法处理中间噪声态。

2. 冻结主干+轻量聚合头:一个高效抗噪的奖励模型框架

具体怎么实现?咱们一步步拆解。
框架总览:PRISM由三部分组成——冻结的视频扩散主干、文本编码器(也是从主干里取的现成embedding层)、以及一个可学习的查询聚合头。整个训练过程中,只有聚合头和投影层的参数在更新,主干一动不动。这保证了训练效率极高,且保留了主干对噪声的天然理解能力。
第一步:噪声感知特征提取。给定一个带噪视频latent z_t和文本提示c,PRISM只取扩散主干前N_b个块的中间特征F_vis(包含空间和时间信息)。为什么不取到最后输出的噪声预测?因为越往后特征越专用于预测噪声,而中间层保留了对视频语义和结构更通用的理解,这在高噪场景下尤为关键。
第二步:查询聚合(Query-based Aggregation)。视觉特征F_vis与文本特征F_txt拼接后(F_uni = [F_vis, F_txt]),通过一个线性投影映射到统一维度D。然后利用N_q个可学习查询向量(实验中设为1)通过交叉注意力机制来“探查”这些特征:哪个token包含偏好关键信息,就分配更大权重。最终将聚合后的单个特征向量送入一个5层MLP,输出一个标量奖励值r(z_t, c, t)
这个设计的关键在于:传统全局平均池化会把所有token等同看待,导致局部瑕疵(比如一只手扭曲了)被背景模糊掩盖。而查询聚合能让模型主动关注“可能出问题”的区域,敏锐捕捉细节缺陷。
第三步:带平局的Bradley-Terry训练损失。PRISM采用配对偏好训练,每对样本(z^A, z^B)有标注结果(A胜、B胜或平局)。考虑到当两段视频质量接近时,人类标注者也会犹豫,所以论文引入了一个平局阈值η(设为5.0),采用Bradley-Terry with Ties(BTT)模型来计算偏好概率。损失函数在一个噪声时间步t均匀采样优化,确保模型在所有噪声水平下都有一致的偏好判断能力。
下图展示了PRISM的完整推理流程:
图3:PRISM赋能的Best-of-N采样流程。传统方法需对所有候选完成完整去噪和VAE解码,PRISM在早期噪声潜伏空间中直接评分,只保留最优候选继续生成,其余立即剪枝。
图3:PRISM赋能的Best-of-N采样流程。传统方法需对所有候选完成完整去噪和VAE解码,PRISM在早期噪声潜伏空间中直接评分,只保留最优候选继续生成,其余立即剪枝。

3. 一张图看懂PRISM的显著优势:噪声鲁棒性碾压传统方法

咱们直接用数据说话。图2是PRISM与现有最佳像素级奖励模型(VideoReward、UnifiedReward、VideoScore2)在不同噪声水平下的偏好预测准确率对比。横坐标是时间步t,越向右噪声越大(t=989接近纯噪点),越向左越清晰(t=0为干净帧)。
图2:PRISM与像素级奖励模型在不同噪声水平下的偏好对齐准确率。传统方法在高噪声下性能崩溃,PRISM始终保持较高准确率。
图2:PRISM与像素级奖励模型在不同噪声水平下的偏好对齐准确率。虚线是传统方法,实线是PRISM变体。左图在VideoGen-RewardBench上,右图在VLRM-Bench上。可以看到,当噪声水平较高(t>600)时,VideoScore2和UnifiedReward的准确率暴跌至接近随机(约20-30%),而PRISM所有变体(即使最小的Wan2.1-1.3B)都能保持55%以上,甚至比最强的像素模型在干净视频上的表现还高。
再来看定量结果表。下表展示了PRISM与三种基线模型在8个噪声水平的“含平局”(w/ Ties)和“不含平局”(w/o Ties)两种指标下的表现:
表1:偏好预测准确率定量结果。PRISM在所有噪声水平下均最优,尤其在极端噪声(t=989)下优势巨大。
表1:偏好预测准确率定量结果。PRISM在所有噪声水平下均最优,尤其在极端噪声(t=989)下优势巨大。请注意,传统像素级模型在t=989时“含平局”准确率接近或低于随机(50%),而PRISM仍能维持在50%以上。
从结果还能看出两个有趣现象:Wan2.1-1.3B(仅13亿参数)的表现远超CogVideoX-2B(20亿参数),这说明生成主干的内在质量比参数规模更重要——Wan2.1架构设计更优。同时,同一家族内缩放收益明显:Wan2.1-14B全面优于1.3B。

4. 推理效率革命:早期最佳N采样实现7.6倍加速

Best-of-N(BoN)采样是提升生成质量的有效手段:一次性生成N个候选,用奖励模型挑出最好的一个。传统做法是先完整生成N段视频,依次解码,再用VLM打分——计算量直接乘以N。PRISM的出现彻底改变了游戏规则:它能在去噪的早期(比如第5步或第10步)就对候选做出准确排序,然后只保留分数最高的那一个继续去噪,其余立即终止。
下图展示了效率-质量权衡:
图5:BoN采样在不同干预步骤(Step)下的效率-质量权衡。柱状图表示相对时间开销(以VideoScore2基线为1),折线表示VBench得分。PRISM在Step 5即达到性能平台,时间开销仅为基线的13-19%。
图5:BoN采样在不同干预步骤下的效率-质量权衡。柱状图表示相对时间开销(以VideoScore2基线为1),折线表示VBench得分。PRISM在Step 5即达到性能平台,时间开销仅为基线的13-19%,即最高7.6倍加速。
更关键的是,加速没有牺牲质量——在BoN(N=5)实验中,PRISM筛选出的视频在VBench各项指标上全面超越随机基线,甚至优于用完整去噪的像素模型(见表2)。
表2:Best-of-N采样定量结果。PRISM在不同骨干模型上均取得最佳或次佳VBench分数,且选择步骤(Step 1/5/10等)几乎不影响生成质量。
表2:Best-of-N采样定量结果。PRISM在不同骨干模型上均取得最佳或次佳VBench分数,且选择步骤(Step 1/5/10等)几乎不影响生成质量。值得注意的是,即使只在Step 1(不到1%的去噪进程)进行选择,PRISM选出的视频质量仍显著优于随机基线。
而且,PRISM这种“原生噪声评估”的能力,为视频生成带来的不止是加速——它使得推理时scaling成为真正可行的工具。以前大家觉得BoN太贵,最多用N=2或3;现在PRISM让N=10甚至更大也毫无压力。论文中实验显示(见附录图4),随着N增大,VBench分数持续提升,且效率依然远超传统方法。
图4:不同N(3,5,10)下BoN的效率-质量权衡。N越大质量越高,但PRISM的早期干预仍保持极低开销。
图4(附录):不同N(3,5,10)下BoN的效率-质量权衡。N越大质量越高,但PRISM的早期干预仍保持极低开销。

5. 深入理解:注意力图揭示模型如何“看到”画质缺陷

前面说的全是量化指标,你可能还是会疑惑:PRISM到底靠什么来区分好视频和差视频?论文提供了一组极具解释性的可视化——查询聚合模块的交叉注意力图(图6)。
图6:查询聚合模块中的注意力图可视化。对于主语义区域(如飞机、泰迪熊),模型对高保真结构赋予更高注意力权重;而结构扭曲或纹理异常的区域响应被抑制。
图6:查询聚合模块中的注意力图可视化。左列为次优视频,右列为优选视频。红色框标出视频中的关键区域,白色框在注意力图中指出模型关注的区域。可以看到,在主语义区域(如飞机、泰迪熊),模型对高保真结构赋予更高注意力权重;而结构扭曲或纹理异常的区域响应被抑制。这说明PRISM的评分可解释性极强——它能精准定位到“哪些地方画坏了”,像一名挑剔的质检员逐帧检查。
这种可解释性对未来调试生成模型、做细粒度强化学习反馈非常有价值。比如,当你发现模型总是对“手部”区域赋予低注意力时,就知道重点该加强手部生成质量了。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问:PRISM的“冻结主干”是什么意思?为什么能冻结?答:扩散主干(比如Wan2.1的DiT)经过海量视频预训练后,其内部中间层已经学会了丰富的语义和结构特征,这些特征对噪声具有鲁棒性。冻结意味着这些层的参数在训练PRISM时完全不更新,只训练上面新加的聚合头。好处是:训练极快(只需要优化很少参数),且不会破坏主干已有的噪声理解能力。

问:文中的“VLM”和“VAE”具体指什么?答:VLM即Vision-Language Model,视觉语言模型,如VideoScore2、UnifiedReward,它们需要看到像素级的清晰视频才能做评估。VAE即Variational Autoencoder,变分自编码器,这里特指视频扩散模型中的3D causal VAE,负责将视频压缩到latent空间(编码)和从latent空间重构回像素(解码)。传统奖励模型必须先用VAE解码latent得到像素视频,再送入VLM,这步是计算瓶颈。

问:PRISM能直接用在别的扩散模型上吗?答:可以,但需要该生成模型提供中间层特征接口。论文中在CogVideoX和Wan2.1两个系列上实验成功,说明具有一定通用性。不过如果目标生成模型架构差异极大(比如U-Net结构),可能需要调整特征提取块的层数等超参数。但核心理念——冻结主干+查询聚合——是通用的。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性:★★★★☆

将生成模型的内在判别能力用于reward modeling,思路新颖且实用性强。虽然类似想法在LLM领域有先例(如DDO),但将其系统性地应用到视频生成领域,并解决了噪声鲁棒性和效率两大痛点,实属难得。

实验合理度:★★★★★

实验设计非常全面:对比了多个噪声水平、两种评价指标(含/不含平局)、三种基线模型、两个benchmark,以及BoN的多种early-stop设置。消融实验也很干净。唯一小遗憾是VLRM-Bench的标注一致性细节不够详细,但整体信服。

学术研究价值:★★★★☆

为“生成模型自身即最优评估器”这一范式提供了坚实证据,对后续RLHF for video generation、推理时scaling等方向有重要启发。不过该方法的理论解释(为什么中间特征能蕴含偏好)还不够深入,有待后续工作。

稳定性:★★★★★

PRISM在所有噪声级别下表现稳定,尤其在高噪声时远超传统方法。训练收敛快,超参数敏感度低(通过消融实验确认)。应用于BoN时,早期步骤评分结果与最终质量高度一致,鲁棒性极强。

适应性以及泛化能力:★★★★☆

在CogVideoX和Wan2.1两个不同架构上都验证有效,且能泛化到不同生成器生成的数据上。但仅限于视频扩散模型,不能直接用于其他生成范式(如GAN、自回归视频生成)。

硬件需求及成本:★★★★★

训练仅需优化极少参数(投影层+聚合头),单张A100即可完成。推理时甚至不需要GPU(可用CPU跑交叉注意力?但原文未明确),且早期干预省掉了大部分去噪计算。综合成本极低。

复现难度:★★★☆☆

论文未开源代码,但描述很详细,主要细节都有(层数、维度、学习率等)。构造训练数据需要生成大量配对视频和人工标注,门槛稍高。不过按照论文提供的VBench prompts和标注协议应该可以复现。

产品化成熟度:★★★★☆

非常接近产品落地——推理效率极高,噪声鲁棒性保证稳定性,且不依赖昂贵的外部VLM。可以集成到视频生成产品中做实时质量筛选或RLHF微调。不过需要针对具体使用场景重新训练少量配对数据。

可能的问题:论文目前只验证了中等规模模型(2B/14B),在更大视频生成模型(如Sora级别的)上是否仍有效有待验证。另外,早期干预虽然高效,但如果生成器质量本身波动大,早期信号可能不如后期可靠,需要进一步分析。


主要参考文献

[1] Wu et al., “Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models”, arXiv:2606.20310v1, 2026.
[2] He et al., “VideoReward: Learning Reward Models for Video Generation”, 2025.
[3] Wang et al., “UnifiedReward: Towards Unified Reward Evaluation for Visual Generation”, 2025.
[4] Yang et al., “VideoScore2: Fine-grained Video Reward Model”, 2025.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
🎬还想了解更多视频生成、奖励模型的前沿干货?想跟龙哥和其他志同道合的AI研究者一起讨论PRISM这种“零解码评分”的骚操作吗?
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 视频生成+上海+城大+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。