← 返回 PaperDaily
视觉与图像
文生视频最难啃的骨头,被cIPO用"重建误差"啃下来了
文生视频最讨厌的就是中间有几帧突然崩坏,而现有DPO类偏好优化连"错题"都找不准。快手Kling团队这篇cIPO,直接从模型自己的去噪重建误差里抠出偏好信号,把优化火力集中到高错误时间窗口,不用人工标注、不用外部奖励模型,MotionBench上Forensic从0.830涨到0.876,思路清奇且工程上很容易复现。
龙哥读论文
发布于 2026-09-05 00:31:10
阅读 4
查看原文
原论文信息如下:
文生视频这两年进步飞快,但有个特别让强迫症抓狂的现象:一段视频前几秒还挺正常,突然某几帧开始抽风,手拧成麻花、人物闪成电灯泡、动作直接卡成PPT。更气人的是,这些问题往往只出现在短短一小段里,其余帧都好好的。这种"局部翻车"让视频整体观感大打折扣,也成了当前视频生成模型迈向真实感的最大绊脚石。
怎么修?业界主流思路是"偏好优化":让模型学会区分"好视频"和"坏视频",然后往好的方向推。比如直接用人类标注排序的DPO,或者训练一个奖励模型来打分。可这些方法放到视频领域,全都撞上了两堵墙。
第一堵墙,是偏好信号从哪来。 找人来标,贵且慢;而且人工标注是"事后离线"的,根本跟不上模型在训练过程中不断变化的犯错模式。训练一个奖励模型打分呢?奖励模型本身就是个外部评判者,自带偏见,还容易被"奖励黑客"钻空子。
视频生成中的“时间瑕疵”为何难解?——两大瓶颈剖析
先来想一个场景:生成一段“人在沙滩上跑步”的视频,前 40 帧一切正常,阳光、海浪、人物姿态全都合理,结果第 41 到 45 帧突然手部扭曲、身形闪烁,然后又恢复正常。这种“突然发作又快速消失”的问题,正是当前文生视频模型最大的痛点之一。
为什么这么难修?因为视频生成中的错误是时间稀疏 的。跟图像生成不同,图像要是崩了,通常整张图都能看出来;而视频可能 99% 的帧都很好,只有短短几帧出问题,比如运动崩溃(motion collapse)、物体闪烁(object flickering)、颜色过饱和(color oversaturation)。这些局部失败虽然短,但对观感的杀伤力极大。
为了修这些问题,社区把目光投向了偏好优化 (preference optimization)。核心思路很直接:给模型看“好的视频”和“坏的视频”,让它学会往好的方向生成。最典型的方法当属直接偏好优化 (Direct Preference Optimization,简称 DPO),这方法最初在语言模型领域爆火,后来被迁移到视频生成上。但视频毕竟不是文本,DPO 类方法在视频领域一上来就撞上了两堵墙。
第一堵墙是偏好归因瓶颈(preference attribution bottleneck) ——可靠的偏好信号到底该从哪来?最朴素的办法是找人来标注,但人工标注成本高、速度慢,而且它是“事后离线”的,注定跟不上模型在训练中不断变化的犯错模式。另一种办法是训练一个奖励模型(reward model)来给生成结果打分,但奖励模型本身也是外部评判者,自带偏见,还容易出现“奖励黑客”(reward hacking)问题——模型找到了奖励模型的漏洞,分数刷得高,实际画质却一塌糊涂。总之,现有的偏好信号要么贵,要么偏,就没有一个“既贴身又靠谱”的。
第二堵墙是时间信用错分配(temporal credit misallocation) ——就算有了可靠的偏好对,把优化平均撒到每一帧上也是浪费。视频的错误分布极不均匀,可能只有 5% 的帧真正出了问题,剩下 95% 的帧都好好的。如果对全部帧一视同仁地施加监督,梯度信号会被大量“健康帧”稀释,真正需要被纠正的“问题帧”反而学不到位。就好比老师批改作业,每道题都花同样的精力,结果大部分时间浪费在已经全对的题上,真正做错的那两三道题反而没讲透。
图1:与基线方法相比,本方法不依赖额外的人类标注或奖励模型,还能自动识别训练中的困难帧。
这两堵墙,恰好对应了论文中总结的两大挑战。快手 Kling 团队和清华大学合作,在这篇论文里提出了一套名为 cIPO 的框架,目标就是同时拆掉这两堵墙。cIPO 的全称是 concentrated Implicit Preference Optimization ,中文可以翻译为“集中式隐式偏好优化”。这个名字里透露出两个关键词:“隐式”对应第一堵墙,“集中”对应第二堵墙。接下来分别拆解。
抛开人工标注与奖励模型:从“重建误差”中挖掘隐式偏好
cIPO 的第一个核心设计,是从模型自身的去噪过程中构造偏好对 。要理解它的精妙之处,得先搞清楚扩散模型(diffusion model)的去噪逻辑。
扩散模型的生成过程可以看作一个“反向去噪”的过程:训练时,模型学会把纯高斯噪声一步步“去噪”成一张图或一段视频。但这里有个隐含的假设——模型的去噪轨迹应该忠实回到真实数据分布。论文画了这样一张示意图来说明问题:
图2:理想去噪应当恢复视频,但模型轨迹因误差累积而漂移,这天然定义了一种隐式训练偏好。
从一张真实视频(黑色箭头起点)出发,加一点噪声,然后让模型去噪。理想情况下(蓝色虚线箭头),模型应该一步步把视频原样恢复出来,回到数据流形上;但现实中(红色虚线箭头),由于模型生成能力有限,去噪轨迹会逐渐偏离理想路径,误差越滚越大,最后生成出来的视频跟原视频差之千里。这种“越滚越偏”的轨迹偏差,恰恰暴露了模型在迭代生成过程中的短板。
cIPO 的做法非常巧妙:把“原视频”当作偏好样本(preferred sample),把“模型重建出来的视频”当作非偏好样本(dispreferred sample) 。具体来说,给定一个真实视频 x,先用编码器 E 把它映射到潜空间得到 z₀,然后用前向扩散过程给它加噪,得到带噪潜变量 z_ts,再从 z_ts 出发让当前模型 f_θ 逐步去噪,得到重建结果 z̃₀⁽ˢ⁾。于是天然构成了一对偏好对:
y⁺ = z₀(干净潜变量,偏好样本) y⁻ = z̃₀⁽ˢ⁾(加噪再重建的潜变量,非偏好样本)
这一下子就绕开了人工标注和外部奖励模型,偏好信号直接从模型自己的去噪轨迹里“长”出来,既贴身又实时。论文给这种信号起了个名字叫隐式偏好 (implicit preference),核心逻辑是:模型在重建过程中哪里容易出错,哪里就是它需要被纠正的地方。
不过这里有一个小问题:论文发现,第一帧的重建效果往往特别差 。这是因为视频扩散模型在生成时高度依赖首帧来锚定场景布局,一旦首帧漂了,整个视频的结构就可能崩塌。为了解决这个问题,cIPO 引入了一个简单但实用的技巧:干净首帧锚定 (clean first-frame anchoring)。具体做法是把非偏好样本的第一帧潜变量直接替换成偏好样本的第一帧:
如果 τ = 1,则 ŷ⁻_τ = y⁺_τ;如果 τ > 1,则 ŷ⁻_τ = y⁻_τ。
这个锚定后的负样本保留了稳定的外观和场景布局参考,后面的帧则能继续暴露时间上的不一致问题,一举两得。
精准打击“问题帧”:时间集中优化策略
搞定了偏好信号来源,接下来要解决的是“优化火力该往哪打”的问题。前面提到,视频生成失败在时间上是稀疏的,均匀监督会浪费大量算力在健康帧上。cIPO 的思路非常直白:先找到错误最集中的时间段,然后把偏好优化集中到这一段上 。
具体做法分三步走。首先,对偏好样本 y⁺ 和锚定负样本 ŷ⁻,计算每一帧的潜空间重建误差 (latent reconstruction error):
d_τ = (1 / CHW) · ||y⁺_τ − ŷ⁻_τ||²₂
其中 τ 是帧索引,C、H、W 分别是潜变量的通道数、高度和宽度。这个公式衡量的是:在每一帧上,模型重建出来的结果跟真实视频差多远。
然后,给定一个窗口长度 K,对每个连续的窗口计算平均重建误差:
D(a) = (1/K) · Σ_{τ=a}^{a+K−1} d_τ
目标是找到平均误差最大的窗口 a⋆,然后把偏好优化的范围限制在这个窗口上。也就是说,优化不再是“整段视频一视同仁”,而是只挑最可能翻车的那一小段连续片段重点突破 。
这里特别值得注意的是“连续窗口”的选择。为什么不直接挑出误差最高的那几帧散着优化,而非要用一个连续窗口?因为视频本质上是时间序列,相邻帧之间存在短时运动依赖。如果单独挑出零散的帧来优化,会破坏这种短时结构,导致优化目标本身就不连贯。连续窗口则能保留局部运动连续性,让优化落在“语义完整”的片段上。
有了集中优化的窗口,最后一步是定义实际的优化目标。cIPO 采用了一种 DPO 风格的成对偏好损失。首先定义每个样本的扩散重建损失 ℓ_θ(y; c, t, ε),它衡量的是模型 f_θ 在给定文本条件 c、扩散时间步 t 和噪声 ε 的情况下,对视频 y 的重建误差。接着定义“模型-参考重建差距”:
Δ_θ(y) = ℓ_θ(y) − ℓ_θref(y)
其中 f_θref 是冻结的参考模型,Δ_θ(y) 衡量当前模型相对参考模型在 y 上是进步了还是退步了。然后构造成对偏好 logit:
g = −(β / 2) · [Δ_θ(y⁺) − Δ_θ(y⁻) + λ · ReLU(Δ_θ(y⁺))]
其中 β 是偏好锐度系数,λ 是稳定性正则项的权重。第一项鼓励模型在偏好样本上取得比非偏好样本更大的相对改进;第二项 ReLU(Δ_θ(y⁺)) 则是一个“赢家保护”惩罚——如果模型在干净的偏好样本上做得比参考模型还差,就触发了惩罚,避免激进更新把原本正确的帧搞坏。这一点在视频设置中尤其重要,因为视频的时间一致性很脆弱,稍微更新过头,可能整段生成质量都崩掉。最终目标函数是标准的 DPO 负对数 sigmoid 损失:L_cIPO = −E[log σ(−g)]。
图4:cIPO框架的三阶段流程:首先通过扩散滚动重建构建隐式偏好对,然后通过帧级潜变量重建误差检测时间上局部化的困难帧,最后将DPO优化集中在高错误段上以改善时间一致性和视觉质量。整个过程在潜空间中进行。
图 4 展示了 cIPO 的完整三阶段流程。整个框架简洁清晰:先构建隐式偏好对,再找高错误窗口,最后集中优化。
全面领先:在 MotionBench 和 WISA 上超越现有方法
方法说得再好,最终要看疗效。cIPO 在两类基准上做了全面评估:MotionBench (一个以运动为中心的文生视频基准,重点考察时间推理和运动真实感)和 WISA (一个物理感知的文生视频数据集,覆盖多样物理规律和场景)。实验基于快手自研的视频基础模型 Wan-VACE 展开,这是一款支持多种条件生成模式的全能视频基础模型。为了隔离偏好优化对运动生成的影响,所有实验统一限制在文本到视频(T2V)生成路径上,微调采用 LoRA 方法。
评价指标分两个维度:真实感 (authenticity)用 Forensic-Chat(一个法医级真实感评分,评估视觉真实性和合成伪影抑制能力)和 OmniAID-Dino(一个基于 DINO 特征的真实感指标,衡量语义真实性和自然度);运动质量 则按照 VBench 协议报告背景一致性、运动平滑度、主体一致性、时间闪烁和整体一致性。
基线方法也选得很有讲究,覆盖了不同偏好信号来源的代表性方法:预训练基线(原始 Wan-VACE,无偏好优化)、DPO(离线,用 VideoReward 标注偏好)、DPO(离线 + GT,用真实视频作为偏好样本的变体)、DPO(在线 + GT),以及 DenseDPO(提供密集段级偏好监督)。这些基线横跨了奖励模型监督、Oracle 偏好构建和密集时间偏好分配三大类,对比阵容相当完整。
表1:MotionBench提示上的定量比较结果,涵盖真实感与运动维度。最佳结果以粗体突出,第二佳结果以下划线标出。Forensic为Forensic-Chat的缩写,Om-D为OmniAID-Dino的缩写,Off/On为离线/在线的缩写,GT为真实视频的缩写。
在 MotionBench 上,cIPO 在真实感的两个指标上把基线远远甩在身后:Forensic-Chat 从 DenseDPO 的 0.819 直接拉到 0.876,OmniAID-Dino 从 0.475 拉到 0.524。运动相关的几个 VBench 指标也几乎全面领先,尤其是运动平滑度从 0.973 涨到 0.989。这说明 cIPO 不是“牺牲运动换真实感”,而是两者兼得。
表2:WISA提示上的定量比较结果,涵盖真实感与运动维度。最佳结果以粗体突出,第二佳结果以下划线标出。
在 WISA 上,优势同样清晰:Forensic-Chat 从 0.909 提升到 0.931,OmniAID-Dino 从 0.486 提升到 0.521,整体一致性从 0.217 涨到 0.247。更值得注意的是,即使跟同样使用真实视频做正样本的 DPO(在线,GT)相比,cIPO 的优势依然很大——这说明 cIPO 的提升不仅仅来自“用了真实视频当正样本”,更来自隐式偏好构建和时间集中优化这两个核心设计。
看看消融实验,能找到更多有意思的细节。论文比较了三种负样本来源:T2V 直接生成、帧条件生成(第一帧一致)、V2V 生成(真实视频引导),以及论文主推的“加噪重建”方法。结果非常明确:不管用哪种负样本,加上时间集中策略(+conc)几乎都能带来一致的提升。而加噪重建本身又是最强的负样本来源,不仅效果好,训练成本还更低——因为重建只需要 5 到 20 步采样,其他方法要走完整的 50 步采样。
表3:负样本构建与采样策略的消融实验。对比不同的负样本来源与采样策略。对于每种负样本来源,选择性采样与均匀采样进行了对比:↑ 表示提升,↓ 表示下降。Time (s) 表示单轮采样时间。
定性结果同样能打。论文在图 5 中展示了几组对比,红色方框标出的是挑战性运动区域。DPO 和 DenseDPO 在这些区域经常出现时间不一致、运动模糊和结构扭曲——比如手和物体的交互不稳定、舞蹈演员旋转时姿态不一致、跑步者的运动轨迹不自然。而 cIPO 在这些地方保持了平滑的时间过渡、稳定的物体几何和更真实的运动动态。
图5:定性结果。与基线方法相比,cIPO在红色方框标出的挑战性运动区域实现了更好的时间一致性。
还有一个值得注意的细节:噪声起始步的选取。cIPO 的负样本来自“加噪再重建”,那么到底加多少噪声合适?论文发现,中等噪声效果最好(对应图 6 中的 10 到 20 步)。加噪太少,负样本太简单,模型学不到东西;加噪太多,重建出来跟原视频语义都对不上,偏好对就没意义了。这个结论符合直觉,也给实际操作提供了明确的参考区间。
图6:负样本采样过程中噪声添加起始索引的变化对视频时间质量和真实感的影响。
进一步的分析将不同噪声水平下生成的视频效果进行了可视化对比(图 7)。弱噪声下,重建结果保留了更多局部纹理和空间细节,但对时间伪影的暴露不足,帧间抖动和闪烁仍可能出现;强噪声下,模型能学到更平滑的运动模式和更稳定的跨帧一致性,但细节模糊和纹理丢失的问题随之而来。中等噪声正好踩在“暴露错误”和“保留语义”的平衡点上。
图7:(a) 推理过程中的重建误差分析;(b) 不同噪声水平的生成效果可视化。
局限与展望:隐式偏好的边界在哪里?
cIPO 的效果确实亮眼,但论文也没有回避方法的边界。最核心的限制是:重建误差只是感知质量的一个代理指标 (proxy),它虽然能捕捉到局部伪影和结构问题,但未必能完全反映高层语义偏好或人类主观判断。换句话说,模型在重建误差上优化得很好,不代表它在所有维度上都符合用户的审美偏好。
另外,当前框架主要针对的是“局部时间伪影”这类问题。如果未来想要让模型学会更全局的叙事连贯性、风格一致性等高层语义属性,单纯靠重建误差来构建偏好对可能不够,还得引入其他形式的监督信号作为补充。
从产品化的角度看,cIPO 的好处是足够“轻”——它不需要额外的人力标注流程,不需要训练外部奖励模型,只需要用模型自己加噪重建,训练成本比完整采样低不少。这种特性让它很容易嵌入到现有的视频生成模型训练管线中,作为后训练(post-training)的一环来使用。可以预见,类似的“自生成偏好”思路会被更多团队采纳,朝着“模型自己当自己的老师”的方向演进。
龙迷三问
DPO 和 cIPO 到底有什么本质区别? DPO 需要提前准备好成对的偏好数据(好视频 vs 坏视频),不管这些数据是人工标注的还是奖励模型评分的,本质上都是“离线”的——先造好数据,再训练模型。cIPO 则是“在线”地从模型自己的去噪轨迹中构建偏好对:把真实视频加噪,让模型自己去重建,重建得不好的地方就是负样本。信号来源完全不同,cIPO 绕开了所有外部标注和评分环节。
“时间集中优化”具体是怎么实现的?会不会导致模型只学会修那几帧,其他帧反而退步? 实现上就是先算每帧的重建误差,然后滑窗找平均误差最大的连续 K 帧,只在这 K 帧上算偏好损失。论文里还加了一个“赢家保护”正则项(对应公式里的 ReLU(Δ_θ(y⁺)) 项),如果当前模型在干净的偏好样本上做得比参考模型还差,就会触发惩罚,防止优化过头把原本正确的帧搞坏。从实验结果看,其他帧的指标也没有掉,说明这种担心是多余的。
这套方法能不能用到其他视频生成模型上?迁移成本高不高? 原则上完全可以。cIPO 是在 Wan-VACE 上验证的,但它的核心逻辑——加噪重建构建隐式偏好 + 时间集中优化——不依赖特定模型架构,任何基于潜在扩散模型的视频生成器都能套用。迁移成本主要在三块:改训练代码、调节噪声起始步和窗口长度、准备训练数据(真实视频)。整体来说比训练一个奖励模型要省事得多。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
隐式偏好构建和时间集中优化的组合在视频偏好优化领域确实少见,属于“思路清奇、实现简洁”的类型。虽然没有提出全新的理论框架,但在问题定义和方法设计上都展现出了不错的原创性。
实验合理度: ★★★★☆
对比基线覆盖面广,从离线 DPO 到在线 GT 再到 DenseDPO 都有涉及,消融实验设计也把负样本来源和采样策略两个关键变量拆得很开,实验逻辑清楚。唯一的小遗憾是没有跟更多近期的视频偏好优化工作做对比。
学术研究价值: ★★★★☆
把“模型自生成的偏好信号”这个方向往前推了一大步,对后续研究很有启发。特别是“从去噪轨迹中挖掘隐式偏好”这个思路,可能会影响视频偏好优化的多个子方向。
稳定性: ★★★★☆
两个基准上的指标全面领先,且不同噪声水平和窗口设置下的表现都有分析,整体稳定性较好。不过,对噪声起始步和窗口长度有一定敏感性,落地时需要花点时间调参。
适应性以及泛化能力: ★★★★☆
在 MotionBench 和 WISA 两个不同侧重点的基准上都有明显提升,说明方法对不同类型的视频内容都能适应。但目前只在文生视频路径上验证过,图像到视频、视频到视频等其他条件生成模式下效果如何还不清楚。
硬件需求及成本: ★★★★☆
重建只需要 5 到 20 步采样,比完整 50 步采样便宜得多;LoRA 微调本身也够省资源。相比依赖外部奖励模型的方法,省掉了额外模型训练和推理的开销。
复现难度: ★★★★☆
方法核心不复杂,没有花哨的模块,基于现有扩散模型加一个偏好损失就能实现。论文提供了项目主页,预计代码也会开源。扣掉一星是因为论文没放出具体的窗口长度 K 和噪声起始步的默认值,需要自己调。
产品化成熟度: ★★★★☆
作为后训练方案,cIPO 的工程接入成本很低,不需要额外数据标注和外部模型,适合直接嵌入现有视频生成模型的训练管线。本质上是个“训练时多花点钱、推理时零额外开销”的方案,这对产品化非常友好。
可能的问题:
重建误差作为感知质量的代理指标,对高层语义偏好和主观审美维度的覆盖不够全面;窗口长度 K 和噪声起始步两个关键超参需要针对不同模型重新调优;实验只在单一基础模型上验证,跨模型泛化性需要更多证据。
[1] Cheng G, Yang D, Huang Z, et al. Realdpo: Real or not real, that is the preference. arXiv preprint arXiv:2510.14955, 2025.
[2] Cheng H, Dong Q, Peng L, et al. Discriminator-free direct preference optimization for video diffusion. arXiv preprint arXiv:2504.08542, 2025.
[3] Hong W, Cheng Y, Yang Z, et al. MotionBench: Benchmarking and improving fine-grained motion understanding for video generation. 2025.
[4] Huang Z, et al. VBench: Comprehensive benchmark suite for video generative models. CVPR 2024.
[5] Rafailov R, Sharma A, Mitchell E, et al. Direct preference optimization: Your language model is secretly a reward model. NeurIPS 2023.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
视频生成最气人的不是全片崩坏,而是前9秒都好好的、最后1秒手突然拧成麻花。cIPO这种"精准锁错题"的思路,像不像你当年考前突击专攻薄弱点?想跟龙哥一起蹲更多快手Kling、清华等顶会团队的最新神作,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 视频生成+北京+快手+某某),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。