← 返回 PaperDaily
视觉与图像
告别VAE解码瓶颈!让生成器自己当评委,视频对齐又快又准
继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生
龙哥读论文
发布于 2026-08-14 09:10:41
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 想第一时间拿到PRISM这种“零解码”奖励模型的源码和更多SOTA思路?公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 继2026年6月推过AVDM2、DenseDPO等视频生成加速和对齐方法后,今天这篇城大新作PRISM,直接把视频生成模型本身变成了最懂行且最快速的“评委”。以往用大视觉语言模型当裁判,又慢又贵,还得等视频全生成完。PRISM反其道而行之,冻结生成模型,在满是噪声的潜伏空间里就能精准打分,还能在生成早期就淘汰烂片,推理提速7.6倍。这波操作,值得所有做视频生成对齐的龙迷细品。
原论文信息如下:
大家好,我是龙哥。今天咱们来聊一篇视频生成对齐方向的最新力作——来自香港城市大学的PRISM。这名字乍一听像是某种棱镜原理,其实是"Preference Representation in Intermediate States of Video Diffusion Models"的缩写,翻译过来就是“视频扩散模型中间状态下的偏好表征”。说白了,就是让视频生成模型自己在生成过程中“当场打分”,不需要等到视频全生成完再叫一个外部大模型来评价——省时省力还更准。
1. 告别像素域:PRISM如何从噪声中解码偏好?
先打个比方:传统视频奖励模型(VRM,Video Reward Model)就像请一位顶级美食家来品菜——他得等菜做好、装盘、端上桌,尝一口才能给出评价。而PRISM的思路是:让做菜的厨师本人,在炒菜过程中就判断味道好不好——甚至还在锅里冒着烟的时候就能说“这菜有戏”或“翻车了,重新来”。为什么厨师能行?因为他见过的菜够多,炒每一个步骤时就已经知道成品大概什么样。
PRISM的核心洞察在于:一个经过充分预训练的视频扩散模型(比如Wan2.1或CogVideoX),其内部早已建立了一个丰富的“视频流形先验”——它知道什么样的视频是自然的、什么样的扭曲是异常。哪怕输入是一堆噪声(高噪态latent),模型内部的神经元仍然保留着对清晰结构的“记忆”。基于这一灵感,PRISM干脆把整个扩散主干冻住(freeze),在上面加一个极其轻量的查询聚合头(Query-based Aggregation head),直接从噪声潜伏空间里提取偏好信号。
零VAE解码开销 :传统方法需要把每个候选视频从latent解码到像素域(VAE decode),再送入大视觉语言模型(VLM)评价,这一步极其耗时(以秒计)。PRISM直接在latent里打分,省掉了全部解码。
天然抗噪 :外部VLM面对高噪图直接懵圈——它只见过清晰图片,完全无法理解一团马赛克。而PRISM从扩散模型内部提取特征,这些特征本身就是为不同噪态设计的,所以无论噪声多严重都能稳定输出偏好分数。
下图直观反映了PRISM与传统像素级奖励模型的本质区别:
2. 冻结主干+轻量聚合头:一个高效抗噪的奖励模型框架
框架总览 :PRISM由三部分组成——冻结的视频扩散主干、文本编码器(也是从主干里取的现成embedding层)、以及一个可学习的查询聚合头。整个训练过程中,只有聚合头和投影层的参数在更新,主干一动不动。这保证了训练效率极高,且保留了主干对噪声的天然理解能力。
第一步:噪声感知特征提取 。给定一个带噪视频latent z_t和文本提示c,PRISM只取扩散主干前N_b个块的中间特征F_vis(包含空间和时间信息)。为什么不取到最后输出的噪声预测?因为越往后特征越专用于预测噪声,而中间层保留了对视频语义和结构更通用的理解,这在高噪场景下尤为关键。
第二步:查询聚合(Query-based Aggregation) 。视觉特征F_vis与文本特征F_txt拼接后(F_uni = [F_vis, F_txt]),通过一个线性投影映射到统一维度D。然后利用N_q个可学习查询向量(实验中设为1)通过交叉注意力机制来“探查”这些特征:哪个token包含偏好关键信息,就分配更大权重。最终将聚合后的单个特征向量送入一个5层MLP,输出一个标量奖励值r(z_t, c, t)。
这个设计的关键在于:传统全局平均池化会把所有token等同看待,导致局部瑕疵(比如一只手扭曲了)被背景模糊掩盖。而查询聚合能让模型主动关注“可能出问题”的区域,敏锐捕捉细节缺陷。
第三步:带平局的Bradley-Terry训练损失 。PRISM采用配对偏好训练,每对样本(z^A, z^B) 有标注结果(A胜、B胜或平局)。考虑到当两段视频质量接近时,人类标注者也会犹豫,所以论文引入了一个平局阈值η(设为5.0),采用Bradley-Terry with Ties(BTT)模型来计算偏好概率。损失函数在一个噪声时间步t均匀采样优化,确保模型在所有噪声水平下都有一致的偏好判断能力。
3. 一张图看懂PRISM的显著优势:噪声鲁棒性碾压传统方法
咱们直接用数据说话。图2是PRISM与现有最佳像素级奖励模型(VideoReward、UnifiedReward、VideoScore2)在不同噪声水平下的偏好预测准确率对比。横坐标是时间步t,越向右噪声越大(t=989接近纯噪点),越向左越清晰(t=0为干净帧)。
再来看定量结果表。下表展示了PRISM与三种基线模型在8个噪声水平的“含平局”(w/ Ties)和“不含平局”(w/o Ties)两种指标下的表现:
从结果还能看出两个有趣现象:Wan2.1-1.3B (仅13亿参数)的表现远超CogVideoX-2B (20亿参数),这说明生成主干的内在质量比参数规模更重要——Wan2.1架构设计更优。同时,同一家族内缩放收益明显:Wan2.1-14B全面优于1.3B。
4. 推理效率革命:早期最佳N采样实现7.6倍加速
Best-of-N(BoN)采样是提升生成质量的有效手段:一次性生成N个候选,用奖励模型挑出最好的一个。传统做法是先完整生成N段视频,依次解码,再用VLM打分——计算量直接乘以N。PRISM的出现彻底改变了游戏规则:它能在去噪的早期(比如第5步或第10步)就对候选做出准确排序,然后只保留分数最高的那一个继续去噪,其余立即终止。
更关键的是,加速没有牺牲质量——在BoN(N=5)实验中,PRISM筛选出的视频在VBench各项指标上全面超越随机基线,甚至优于用完整去噪的像素模型(见表2)。
而且,PRISM这种“原生噪声评估”的能力,为视频生成带来的不止是加速——它使得推理时scaling成为真正可行的工具 。以前大家觉得BoN太贵,最多用N=2或3;现在PRISM让N=10甚至更大也毫无压力。论文中实验显示(见附录图4),随着N增大,VBench分数持续提升,且效率依然远超传统方法。
5. 深入理解:注意力图揭示模型如何“看到”画质缺陷
前面说的全是量化指标,你可能还是会疑惑:PRISM到底靠什么来区分好视频和差视频?论文提供了一组极具解释性的可视化——查询聚合模块的交叉注意力图(图6)。
这种可解释性对未来调试生成模型、做细粒度强化学习反馈非常有价值。比如,当你发现模型总是对“手部”区域赋予低注意力时,就知道重点该加强手部生成质量了。
龙迷三问
问:PRISM的“冻结主干”是什么意思?为什么能冻结? 答:扩散主干(比如Wan2.1的DiT)经过海量视频预训练后,其内部中间层已经学会了丰富的语义和结构特征,这些特征对噪声具有鲁棒性。冻结意味着这些层的参数在训练PRISM时完全不更新,只训练上面新加的聚合头。好处是:训练极快(只需要优化很少参数),且不会破坏主干已有的噪声理解能力。
问:文中的“VLM”和“VAE”具体指什么? 答:VLM即Vision-Language Model,视觉语言模型,如VideoScore2、UnifiedReward,它们需要看到像素级的清晰视频才能做评估。VAE即Variational Autoencoder,变分自编码器,这里特指视频扩散模型中的3D causal VAE,负责将视频压缩到latent空间(编码)和从latent空间重构回像素(解码)。传统奖励模型必须先用VAE解码latent得到像素视频,再送入VLM,这步是计算瓶颈。
问:PRISM能直接用在别的扩散模型上吗? 答:可以,但需要该生成模型提供中间层特征接口。论文中在CogVideoX和Wan2.1两个系列上实验成功,说明具有一定通用性。不过如果目标生成模型架构差异极大(比如U-Net结构),可能需要调整特征提取块的层数等超参数。但核心理念——冻结主干+查询聚合——是通用的。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性: ★★★★☆
将生成模型的内在判别能力用于reward modeling,思路新颖且实用性强。虽然类似想法在LLM领域有先例(如DDO),但将其系统性地应用到视频生成领域,并解决了噪声鲁棒性和效率两大痛点,实属难得。
实验合理度: ★★★★★
实验设计非常全面:对比了多个噪声水平、两种评价指标(含/不含平局)、三种基线模型、两个benchmark,以及BoN的多种early-stop设置。消融实验也很干净。唯一小遗憾是VLRM-Bench的标注一致性细节不够详细,但整体信服。
学术研究价值: ★★★★☆
为“生成模型自身即最优评估器”这一范式提供了坚实证据,对后续RLHF for video generation、推理时scaling等方向有重要启发。不过该方法的理论解释(为什么中间特征能蕴含偏好)还不够深入,有待后续工作。
稳定性: ★★★★★
PRISM在所有噪声级别下表现稳定,尤其在高噪声时远超传统方法。训练收敛快,超参数敏感度低(通过消融实验确认)。应用于BoN时,早期步骤评分结果与最终质量高度一致,鲁棒性极强。
适应性以及泛化能力: ★★★★☆
在CogVideoX和Wan2.1两个不同架构上都验证有效,且能泛化到不同生成器生成的数据上。但仅限于视频扩散模型,不能直接用于其他生成范式(如GAN、自回归视频生成)。
硬件需求及成本: ★★★★★
训练仅需优化极少参数(投影层+聚合头),单张A100即可完成。推理时甚至不需要GPU(可用CPU跑交叉注意力?但原文未明确),且早期干预省掉了大部分去噪计算。综合成本极低。
复现难度: ★★★☆☆
论文未开源代码,但描述很详细,主要细节都有(层数、维度、学习率等)。构造训练数据需要生成大量配对视频和人工标注,门槛稍高。不过按照论文提供的VBench prompts和标注协议应该可以复现。
产品化成熟度: ★★★★☆
非常接近产品落地——推理效率极高,噪声鲁棒性保证稳定性,且不依赖昂贵的外部VLM。可以集成到视频生成产品中做实时质量筛选或RLHF微调。不过需要针对具体使用场景重新训练少量配对数据。
可能的问题: 论文目前只验证了中等规模模型(2B/14B),在更大视频生成模型(如Sora级别的)上是否仍有效有待验证。另外,早期干预虽然高效,但如果生成器质量本身波动大,早期信号可能不如后期可靠,需要进一步分析。
主要参考文献
[1] Wu et al., “Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models”, arXiv:2606.20310v1, 2026.
[2] He et al., “VideoReward: Learning Reward Models for Video Generation”, 2025.
[3] Wang et al., “UnifiedReward: Towards Unified Reward Evaluation for Visual Generation”, 2025.
[4] Yang et al., “VideoScore2: Fine-grained Video Reward Model”, 2025.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
🎬还想了解更多视频生成、奖励模型的前沿干货?想跟龙哥和其他志同道合的AI研究者一起讨论PRISM这种“零解码评分”的骚操作吗?
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 视频生成+上海+城大+龙哥) ,根据格式备注,可更快被通过且邀请进群。