← 返回 PaperDaily 视觉与图像

视频生成|复旦快手新研究:同一个PE写两边,T2V多事件生成全面涨点

如果你在公众号里刷到过AI视频生成的翻车现场,大概率见过这种名场面:你明明输入的是“一只熊推开树桩、找到食物、抓住老鼠、吃掉它”,生成的视频里熊只做到了一半就停下来,甚至干脆把树桩忘了。这不能全怪视频生成模型“笨”。真…

视频生成|复旦快手新研究:同一个PE写两边,T2V多事件生成全面涨点

paperdaily_reaction_gif

训练与推理的提示词对不上?CAPE-T2V对症下药

如果你在公众号里刷到过AI视频生成的翻车现场,大概率见过这种名场面:你明明输入的是“一只熊推开树桩、找到食物、抓住老鼠、吃掉它”,生成的视频里熊只做到了一半就停下来,甚至干脆把树桩忘了。这不能全怪视频生成模型“笨”。真正的原因往往藏在训练与推理之间一个不容易被看见的缝隙里。
先捋一下当前文本生成视频系统的标准流水线。扩散Transformer(Diffusion Transformer,DiT)是负责把文本变成视频的骨干模型,它在大规模训练时看到的是视频配的“详细描述文本”,描述里把物体、动作、场景交代得清清楚楚。但真实用户不会打那么长的字,他们只会写“熊推倒树桩,找吃的,抓老鼠,吃”。于是工程上就把一个提示词增强器(Prompt Enhancer,PE)放在生成器前面,先由它把用户短句扩写成一段足够详细的条件文本,这段文本才会真正输送给DiT。
问题随即出现:DiT训练时候的输入是“官方标注员写的详细描述”,推理时候的输入却是“PE生成的另一套详细描述”。即便大家都用同一套结构(schema),前者的措辞习惯、信息详略、从哪个角度描述物体、先说背景还是先说镜头,都可能和后者南辕北辙。论文把这种残留的分布不对齐称为PE–Caption gap。
图1:部分对齐是不够的。一个StoryEval提示词要求三个连续事件。直接把用户提示词送给原始DiT一个事件也没有完成;Anchored PE配原始DiT和Schema-Aligned DiT都只恢复了不同的单个事件;只有CAPE-T2V——由同一个Anchored PE既写DiT微调文本又改写推理时提示词——完整完成了全部三个事件。每个事件的判定采用与StoryEval评测一致的GPT-5.5三调用一致协议。
图1是论文中最直观的例证。一个用户提示词里包含“打开CD托盘、放入光盘、关闭托盘”三个连续事件,基线系统要么一个都没完成,要么只完成了其中一个。只有CAPE-T2V把三个事件完整地拍了出来。这背后的关键就在于:这篇来自复旦大学与快手Kling团队的工作,试图把训练和推理的两侧文本真正“对齐”到同一个人手中。

同一个“翻译官”:Anchored PE如何同时写两边

CAPE-T2V的思路可以概括成一句话:让同一个提示词增强器同时担当“训练文本作者”和“推理文本改写者”,从源头上消除两边的作者风格差异。整个方法分为两步,整体框架见图2。
图2:CAPE-T2V总览与匹配对照。第一步,PE在简洁源文本、详细源文本、伪用户提示词三类输入上训练,统一映射到由外部描述器(captioner)生成的目标上,得到Anchored PE。第二步,Anchored PE生成的文本用于微调PE-Aligned DiT;匹配对照的Schema-Aligned DiT则用另一个引导式schema-aligned改写器生成文本进行微调;推理时两个DiT都用Anchored PE。
第一步叫做“把PE锚定到描述器生成的目标上”。注意,目标不是从某个视频生成模型的原始训练标注里恢复的——那些标注过程和配方往往不公开。论文的做法是找一个外部描述器,让它按选定的六段式schema生成目标文本。然后构造三类训练样本,让PE学会把不同风格的输入都映射到同一类目标上。
这三类样本分别是:一条简洁源文本配目标,用来教PE做结构化扩写;一条详细源文本配同一个目标,用来教PE做保守的规范化(不要随意改动内容);还有一条伪用户提示词配目标,把用户平时那种不完整、口语化的表达带进训练分布。三类输入共享同一批目标,使得PE只认语义,不认输入写法。训练用的是标准的自回归监督微调目标,即公式(1)所示的最大化目标文本的条件概率。
公式(1):PE监督微调损失。其中φ为PE参数,xi为第i个输入文本,yi为第i个目标文本,|yi|为目标文本长度,pφ(yi,j|xi, yi,<j)表示给定输入和之前已生成目标token时,当前token的条件概率。
第二步则是用训练好的Anchored PE来改写视频派生出的密集描述,用改写得到的文本微调DiT,得到PE-Aligned DiT。为了搞清楚“用PE写训练文本”这件事到底起多大作用,论文还专门构造了一个匹配对照组Schema-Aligned DiT:它和PE-Aligned DiT用同样的视频、同样的密集描述来源、同样的schema、同样的优化设置,唯一的区别是它的训练文本由一个独立提示的schema-aligned改写器生成,而不是Anchored PE生成。两边的推理文本则完全一样,都用Anchored PE改写用户提示词。
这样一来,如果CAPE-T2V赢了Schema-Aligned DiT,就能把功劳明确归给“同一作者写两侧文本”这件事,而不是schema本身。方法全程不改变DiT的架构,也不改变训练目标,甚至不需要联合优化PE和DiT,工程上非常利落。整个系统结构可以紧凑地总结为:Anchored PE = 训练与推理共用的唯一文本出口;PE-Aligned DiT = 读完Anchored PE的“作文”之后再被调教过的生成器。

六段式schema:从“结构对齐”到“风格对齐”的升级

论文采用的共享schema是从MiraData的六类描述整理出来的,依次是:短描述、密集描述、主物体描述、背景描述、镜头描述、风格描述。这六段合在一起,分别覆盖全局语义、时间细节、主体、场景、镜头运动和视觉风格,对视频生成条件的刻画比较完整。
但论文认为,仅仅让两边“都有这六段”是不够的。schema只规定了“有哪些部分、按什么顺序出现”,并没有规定每一段里如何选细节、如何组织信息、描述粒度到什么程度、用哪些词。同一个视频,由不同的描述器来写,完全可能写出内容不同但都符合同一schema的两篇文本。图3给出了一个非常生动的例子:锚定PE和引导式改写器处理同一个密集描述,一个写“一只熊在雪地中推倒树桩,随后抓到一只老鼠并将其吃掉”,另一个写“熊用前爪推倒枯木,找到树根下的食物,捕到一只鼠类,吞食”。骨架相同,血肉完全不同。
图3:共享schema内部的四维残余条件不匹配。从同一个视频派生密集描述出发,引导式改写器生成Schema-Aligned DiT的训练文本,Anchored PE生成PE-Aligned DiT的训练文本。配对示例展示了两个文本操作者在细节选择、信息组织、描述粒度和措辞四个维度上可以不同,即便遵循相同的六段式schema。
所以CAPE-T2V做的事比“结构对齐”更进一步,可以理解为“风格对齐”:不是规定文本长什么样,而是规定文本由谁来写。同一个作者写训练文本和推理文本,至少在细节选择、措辞习惯和信息组织方式上保持内在一致。这种设计的好处是,即使换一个目标生成器,只要它的推理环境还是“PE改写再进DiT”,就可以沿用这套methodology,不用去破解每个生成器私有的标注配方。

两个模型、三大benchmark:增益是否站得住脚

方法讲得再漂亮,最终还是要看实验结果。论文选择了两个差异明显的视频生成模型:万卡团队的Wan2.2-T2V-A14B和Lightricks的LTX-2.3;三个评测集:面向多事件结构生成的StoryEval、评估内在忠实度的VBench-2.0、考察组合生成能力的T2V-CompBench。
实验设置了五条对照路径:不用PE直接生成(None)、用每个生成器官方PE(Official PE)、只用Anchored PE替换推理时PE但DiT不微调、Anchored PE配Schema-Aligned DiT、以及Anchored PE配PE-Aligned DiT(也就是完整CAPE-T2V)。这样安排的好处是,每一步改动带来的增益都能被单独拆出来。
表1:主要评测结果(%)。StoryEval列报告事件完成率,Overall为全提示词集合的聚合结果。Anchored PE + PE-Aligned DiT就是CAPE-T2V。分数越高越好,粗体和下划线分别表示每个模型族内的最好和次好结果。
表1的关键结论非常清晰:在全部六个“模型×评测集”组合上,CAPE-T2V相对Schema-Aligned DiT都有提升。Wan2.2上的StoryEval、VBench-2.0、T2V-CompBench分别涨了1.6、1.12和0.30个百分点;LTX-2.3上对应涨了1.4、0.92和0.65个百分点。增益不是特别夸张,但胜在一致——两个架构不同、训练范围不同的模型都出现了同样的趋势,说明不是偶然。
更值得注意的一点是,Anchored PE在Wan2.2上把StoryEval从官方PE的47.5抬到了64.6(+17.1),但在LTX-2.3上反而比官方PE低了0.6个点。这说明Anchored PE单独拿出来并不总是强于官方PE——它只是一个“中立的、可复用的改写器”。但它配PE-Aligned DiT之后,不管官方PE强不强,都比Schema-Aligned DiT好。这正好呼应了论文的主旨:真正的收益来自“谁写的训练文本”,而不是“谁的改写水平更高”。
除了聚合分数,论文还放了不少定性对比图。比如图6展示“CD托盘打开→放入光盘→关闭”和“一个人叠衣服→起身→看书”的顺序任务;图8展示“阿尔罕布拉宫第一视角斜拍空中推轨”这种动态轨迹控制;图10展示“男人脱帽→抛向空中→被老鹰取走”这类交互和绑定关系。这些案例里CAPE-T2V的事件完整度和画面稳定性普遍更优,但也要承认某些复杂动作仍然存在视觉歧义,比如图7里熊“最终抓住并吃掉老鼠”的瞬间,画面其实仍然模糊。
图6:有序多事件执行(I)。每帧截取自原始合成图的对应行。(a)中,None反转了插入顺序,Anchored PE省略了初始的关闭托盘状态,Schema-Aligned DiT引入了光盘但未稳定放置,CAPE-T2V最清晰地渲染了关闭–打开–放入–关闭。(b)中,None和Schema-Aligned DiT改变了人物,Anchored PE转折较突兀,CAPE-T2V更好地覆盖了叠衣、起身、翻书和阅读。 图10:交互与主客体绑定(I)。(i)中,None模糊了帽子传递,Anchored PE把老鹰和帽子分离,Schema-Aligned DiT缺少稳定的承接终点;CAPE-T2V让摘下、抛出、接近以及最终鹰帽绑定最清晰可见。(j)中,None原样保留结构,Anchored PE没有完成释放,Schema-Aligned DiT保留手状接触;CAPE-T2V最清楚地展示了下放、接触、释放、独立漂浮的过程。

MMD²说话:分布差距真的缩小了吗

指标涨了,但论文想证明的不只是“效果好”,而是“PE–Caption gap确实变小了”。为此它引入了一个比较硬核的度量:最大均值差异平方(Maximum Mean Discrepancy squared,MMD²)。MMD²衡量的是两个分布在高维嵌入空间里的距离,值越低说明两个分布越接近。
具体做法是:对StoryEval、VBench-2.0和T2V-CompBench里的全部3053条用户提示词,用固定种子的Anchored PE各生成一条推理改写,构成参考分布;再把两组DiT微调文本(Anchored PE写的和prompted rewriter写的)分别与参考分布计算MMD²。文本先经过冻结的Qwen3-VL-Embedding-8B编码成4096维向量并做L2归一化,核函数直接用RBF核。
表2:相对于用户提示词改写的嵌入分布距离。MMD²分别计算两组DiT微调文本与所有StoryEval、VBench-2.0、T2V-CompBench用户提示词的固定种子Anchored PE改写之间的距离,越低越好。表3:54K样本上与配对密集描述源的相似度。每组DiT微调文本都与其配对的视频派生密集描述源比较。ROUGE-L和BLEU-4衡量0–100分的表层重叠,Qwen cosine衡量0–1分的嵌入相似度。
结果如表2所示:在全量比较中,Anchored PE文本相对prompted rewriter文本的MMD²从0.0758降到了0.0673;在控制词长的匹配比较中从0.0764降到0.0682。两者大约都是11%的下降,方向完全一致。论文还贴心地控制了Qwen的词长,避免“只是Anchored PE写得更短所以更像用户输入”这种解释。
图4:三个文本分布的定性投影。参考集包含用seed 42对StoryEval、VBench-2.0、T2V-CompBench全部3053条用户提示词做Anchored PE改写得到的一条改写;两组微调文本集从匹配的密集描述源中采样。十字标记质心,椭圆概括投影分布形状。
另一个重要的排除性证据藏在表3里。Anchored PE文本的ROUGE-L(59.79比58.03)和BLEU-4(43.90比42.13)都变低了,说明它并不是靠更多地复制密集描述源里的原词来贴近推理分布;而Qwen cosine相似度几乎没变(0.93610对0.93467),说明它在语义层面仍然贴着源描述内容。这就把“距离缩小”明确归因于“文本实现方式的差异”,而不是“copy更多训练原材料”。图4的二维投影也直观地展现了Anchored PE微调文本分布比rewriter文本分布更靠近推理参考分布。

局限与展望:这篇论文还能怎么接着做

论文的实验做得比较扎实,但远没有到“终结问题”的程度。先说数据规模:经过一致性过滤后用于DiT微调的只有54K视频-文本对,对视频生成这种数据饥渴的任务来说并不算多。这个规模限制主要来自一致性过滤的严格程度和高质量视频标注的成本,也意味着目前展示的增益可能是在“低数据上限”下的保守估计。
其次是schema的选择。六段式来自MiraData,但MiraData本身是图片数据,搬到视频生成的描述上是否已经最优,论文没有做消融。不同生成器的训练标注风格差异很大,如果某个生成器内部用的其实是另一套schema,将来是不是需要针对生成器调整schema?这个问题论文没有回答,只提到“schema可以按应用需求选择”。
评测上的潜在瑕疵也值得一提。StoryEval官方协议是用GPT-4系列做裁判判断事件是否完成,这里换成了GPT-5.5,并沿用三调用一致规则。虽然论文声称保持了一致性,但换裁判模型毕竟引入了不可直接对比的风险。MMD²衡量的也只是固定嵌入空间里的全局分布距离,并不保证每条用户提示词上的逐例对齐都变好。
这些局限反过来也指明了后续价值最高的几个方向:一是把Anchored PE的规模做大、把微调数据的质量过滤做得更细,看增益能否进一步放大;二是尝试让schema本身参与学习,而不是人工固定;三是将这个“两侧同作者”的策略移植到更多视频生成模型,甚至扩展到图像生成、音频生成等同样存在PE前置环节的领域。论文的实验已经证明,这方法对Wan2.2和LTX-2.3这两个架构差异很大的模型都有效,未来扩展的空间是真实存在的。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对文本生成视频中提示词增强与训练文本的分布偏差,CAPE-T2V先锚定增强器到六段式结构目标,再用同一增强器生成微调扩散Transformer的训练文本,实现训练与推理双向对齐。
这篇工作最值得看的点是什么?CAPE-T2V在两个模型家族、三个benchmark上全部六个模型-基准组合均取得最高分;相对Schema-Aligned DiT对照,Wan2.2在StoryEval/VBench-2.0/T2V-CompBench上分别提升1.6/…
这篇工作的边界或风险在哪里?优点:问题定义清晰(PE-Caption gap),机制简洁有效,不改变DiT架构与训练目标,无需生成器原生caption配方,跨两个异构模型验证一致增益;实验控制严谨,匹配对照组设计干净,并辅以MMD²分布分析与词面/嵌入双重诊断。缺点…
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

识别出结构对齐之外的残差gap,并提出“用同一个PE写两侧文本”这种解耦式对齐思路,角度新颖且工程友好。

实验合理度:★★★★☆

匹配对照设计严谨,排除了schema、数据、优化等干扰因素;两模型三benchmark一致提升,具有较强的说服力。

学术研究价值:★★★★☆

给出了“训练-推理文本分布对齐”的一个新视角,对条件生成领域有启发意义;MMD²度量框架也可复用于后续工作。

稳定性:★★★☆☆

聚合指标稳定提升但幅度不算大(0.30~1.6个百分点),部分案例在复杂交互上仍存在视觉歧义,未能完全消除。

适应性以及泛化能力:★★★★☆

不修改DiT架构和训练目标,可移植到带推理时PE的生成器;已在两个差异较大的模型上验证。

硬件需求及成本:★★★☆☆

PE推理和微调用较小模型即可,但DiT微调需要32张NVIDIA H20(141GB)GPU,训练成本仍然偏高。

复现难度:★★★☆☆

代码已开源,但数据构造、一致性过滤和训练pipeline较为复杂,完整复现仍需不少工程投入。

产品化成熟度:★★★☆☆

Anchored PE可即插即用,DiT微调流程适合作为内部标准pipeline;以开源产品和文档完备度衡量,还有一段距离。

可能的问题:MMD²作为全局分布度量无法展示per-prompt级别的对齐细节;实验只报告聚合分数,个别维度波动未被讨论;对更极端或更长的用户prompt的鲁棒性尚未验证。


主要参考文献

Jia Y, Hua J, Zhang Y. CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation[J]. arXiv preprint arXiv:2608.03046, 2026.
Wan Team. Wan2.2 technical report[R]. 2025.
HaCohen T, et al. LTX-2.3 technical report[R]. Lightricks, 2026.
Ju X, et al. MiraData: A large-scale video dataset with long and rich dense captions[C]. CVPR 2024.
Wang Y, Yang X. VidProM: A million-scale real prompt-gallery dataset for text-to-image diffusion models[J]. NeurIPS 2024.
项目主页:https://github.com/yizzz927/CAPE-T2V

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击


原论文信息如下:
论文标题:
CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation
发表日期:
2026年08月
论文作者:
Yizhuo Jia, Jingyun Hua, Yuanxing Zhang
发表单位:
Fudan University, Kling Team
原文链接:
https://arxiv.org/pdf/2608.03046v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球