← 返回 PaperDaily 视觉与图像

腾讯中山大学新方法:复杂指令不再乱序

自回归视频最怕的不是慢,而是“顺序一乱就全乱”。TempAct 把规划和执行拆开,再用分层强化学习去训,专治复杂时间指令下的语义混淆、提示切换失灵和误差传染,思路很像给视频模型配了个会排兵布阵的总指挥。

腾讯中山大学新方法:复杂指令不再乱序
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
自回归视频最怕的不是慢,而是“顺序一乱就全乱”。TempAct 把规划和执行拆开,再用分层强化学习去训,专治复杂时间指令下的语义混淆、提示切换失灵和误差传染,思路很像给视频模型配了个会排兵布阵的总指挥。


原论文信息如下:
论文标题:
TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL
发表日期:
2026年06月26日
发表单位:
中山大学深圳校区、腾讯混元、清华大学、北京大学、北京科技大学
原文链接:
https://arxiv.org/pdf/2606.28016v1.pdf
开源代码链接:
https://github.com/jingw193/TempAct
项目链接:
https://jingw193.github.io/TempAct/
自回归视频生成这件事,表面上是在“边看边画”,实际上最容易翻车的地方不是画质,而是顺序。前一秒还在切番茄,后一秒就直接端盘子;前一段还在追球,下一段球已经叼回来了。画面看着挺像那么回事,事件顺序却像被打乱的接力赛。TempAct 盯上的就是这个老大难:复杂时间指令下的时序合理性
封面
图1:TempAct 的整体问题意识——不是单纯让视频“更清晰”,而是让事件按该发生的顺序发生

视频生成也有“拖延症”?TempAct 用“计划+执行”治好它!

这篇工作最有意思的地方,是它没有继续和“视频质量”死磕,而是把问题拆成了两层:先想清楚每一段该发生什么,再想办法把这一段演出来。听起来像废话,实际上正是很多生成模型最缺的东西。模型不是不会画,而是常常不知道“这一帧该干嘛、下一段该接什么”。
TempAct 的全称是 Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL,核心意思可以翻成一句大白话:用“规划器+执行器”的强化学习框架,让自回归视频生成更会按时间顺序办事。这里的 RL 是 Reinforcement Learning,也就是强化学习,不是靠老师一帧一帧手把手教,而是让模型自己生成、自己打分、自己修正。
Figure 2: Overview of TempAct
图2:TempAct 方法总览。LLM 规划器先把全局指令拆成带时间跨度的步骤提示词,自回归视频执行器再在共享视觉上下文中生成多个连续片段;嵌套的规划-执行分组用于做分层信用分配。

痛点在哪:全局提示词让AI“蒙圈”,步骤提示词又让AI“摆烂”

自回归视频模型的基本工作方式,是把视频切成一个个 chunk,按顺序往后生成。问题来了:如果整段视频都只喂同一句全局提示词,模型知道“总任务”,却不知道“当前这段该完成哪一步”。于是就会出现典型的时序混淆:该后面发生的动作,提前冒出来;该先做的状态变化,反而被拖到后面。
论文里举的狗狗例子很典型:指令要求它先坐下,再去叼球、奔跑。单提示词版本却可能一开始就把“叼球”画出来,像是把后半段剧情提前剧透了。画面并不一定崩,但事件顺序已经乱了。对于交互式视频生成来说,这种错法最烦:观感上像“差不多”,语义上却是“全错”。
图3相关示意图
图3:单提示词生成常见的“时序混淆”现象。视频看起来还行,但该先发生的事没先发生,该后发生的事却提前上场。
那是不是换成步骤提示词就万事大吉?也没那么简单。步骤提示词确实更明确,但一旦提示切换,执行器就可能出现延迟反应、语义混合、错误传染。前一个动作还没收尾,后一个动作已经开始抢戏;上一段的小失误,还会一路传到后面。说白了,模型不是不会“听话”,而是不会“转身”。
更麻烦的是,单靠监督微调(SFT,Supervised Fine-Tuning,监督微调)和蒸馏,很难直接把这个问题修好。SFT 训练时看的是“干净历史”,推理时却要面对自己生成出来的“脏历史”,这就是典型的 exposure bias,中文一般叫暴露偏差。模型在训练时没见过自己犯错后的样子,上线后却必须在错上加错的环境里活下去,多少有点残酷。

解法来了:LLM 当“总指挥”,视频模型做“精兵强将”

TempAct 的思路很像真正的项目管理:不要指望一个人同时负责“排兵布阵”和“前线冲锋”。它把任务拆成两个角色。规划器负责把全局指令拆成可执行的时间分解,执行器负责在自回归历史下把每一步演出来。一个管“想什么”,一个管“怎么做”。
这里的规划器用的是 LLM,也就是 Large Language Model,大语言模型。它不是拿来聊天的,而是拿来做“时间切分”的:把一个复杂指令拆成若干个带时间跨度的 step prompt,每个 step 负责一个阶段。比如“先坐下,再叼球,再跑回去”,就不是一句话糊到底,而是拆成多个阶段性目标。
但 TempAct 没有把规划器当成一次性预处理器,而是让它和执行器一起接受反馈。这里的关键点是:规划器要学会分出“视频模型真的做得到”的步骤,执行器要学会在历史不完美时依然能切换动作。这就比“先写好脚本,再让演员照着演”更进一步,因为脚本本身也会被演出效果反向修正。
厨师示例对比图
图4:厨师切番茄并摆盘的定性对比。单提示词容易把多个阶段搅在一起,多提示词能缓解但仍会在切换处卡顿,TempAct 则更完整地完成了按序动作。
还有一个很聪明的小设计叫步骤提示平滑。与其在切换点把提示词硬切成“上一句结束、下一句开始”,不如让当前步骤稍微看见下一步的影子。这样做的好处很朴素:模型不会突然被拍一巴掌说“换场了”,而是能提前知道“接下来要往哪儿走”。

怎么做的:分层强化学习,“计划”与“执行”两手抓两手都硬

TempAct 最核心的工程味道,体现在它不是简单地“加一个提示词生成器”,而是把规划和执行都放进了分层强化学习。这里的“分层”不是为了显得高级,而是为了让奖励信号能真正打到该打的地方。
先说规划器。它会从一个全局提示词出发,采样多组候选计划。每个计划都不是一句空话,而是包含了时间切分后的 step prompt。论文里把这种方式称为 span-aware,意思是“知道自己负责哪一段时间”。这个词看着像英文黑话,实际上就是“别一锅端,分段负责”。
然后是执行器。执行器不是只看当前 step prompt,而是在共享视觉上下文里继续往后生成。也就是说,它面对的不是理想历史,而是自己前面已经画出来的内容。这个设定很重要,因为真实推理时,模型必须吃自己产出的“剩饭”,而不能总拿标准答案当拐杖。
TempAct 这里用了一个很像“组队打分”的思路。外层是规划组,比较不同计划谁更靠谱;内层是执行组,在同一个上下文下比较多个续写谁更会转场。这样做的价值在于,奖励不再糊成一团,而是能分清楚到底是计划错了,还是计划没错但执行翻车了
奖励设计也很讲究。规划器拿到的是两类反馈:一类看计划本身是否忠实、完整、顺序合理;另一类看这个计划实际生成出来的视频是否真的按顺序发生。执行器则主要看切换点之后的第一段,也就是新步骤刚激活时有没有立刻跟上。这个选择很聪明,因为很多错误不是在整段视频里平均发生的,而是恰恰卡在“换动作”的那一瞬间。
为了让模型别为了“语义正确”把画面搞得太怪,执行器还加了美学约束和 KL 约束。KL 是 Kullback-Leibler divergence,中文常说KL 散度,这里的作用很实在:别让策略飘得太远,免得为了追分把视频画风搞崩。说白了就是给模型拴一根安全绳,防止强化学习越训越野。
Table 2: Component ablation
表2:组件消融实验。左侧展示逐步加入步骤提示、提示平滑、规划器强化学习和执行器强化学习后的变化;右侧展示规划-执行强化学习训练过程中的奖励轨迹。

效果如何:时序更合理,质量不掉队,人机都爱它

TempAct 的实验对象不是凭空造出来的玩具模型,而是两个真实的自回归视频骨干:Self-Forcing 和 LongLive。评价也没有只看“画面好不好看”,而是专门构建了一个Temporal Order benchmark,也就是时间顺序基准,分成简单集和困难集,专门测试模型能不能按要求把事件顺序做对。
Table 1: Comparison of different methods on the Temporal Order benchmark
表1:不同方法在时间顺序基准上的对比。以 Temporal-Following Score 为主指标,分简单集、困难集和不同评审器统计结果。
先看最核心的结论:TempAct 确实把时序分数拉上去了,而且不是小修小补。以 Self-Forcing 为例,平均 Temporal-Following Score 从 0.400 提升到 0.462,相对提升 15.5%;在 LongLive 上也从 0.432 提升到 0.488,相对提升 13.0%。更重要的是,这种提升不是只在某一个子集或者某一个评审器上“碰巧有效”,而是在简单集、困难集、域内评审器和域外评审器上都能看到一致收益。
这说明 TempAct 改善的不是某种“专门讨好评测器”的小技巧,而是更接近真实任务本身的能力:把事件顺序组织对,把提示切换执行对。如果只是把视频画得更像训练集,换个评审器很可能就露馅;而这里连没参与训练的 Gemini-3-Flash 评审器也认可,说明方法并不是只会“刷题”。
更让人舒服的是,时序提升并没有把画质拖下水。Self-Forcing 上 VBench 总分几乎不变,LongLive 上甚至还有小幅提升,PickScore 也基本持平。这个结果很关键,因为很多“语义对齐”方法最后都会把画面训得一股子奖励黑客味:语义是对了,视频也更像“模型自己觉得对了”,但人看着不一定舒服。TempAct 至少在这组实验里没有犯这种毛病。
图4相关示意图
图5:LongLive 骨干上的定性对比。TempAct 在复杂时间指令下更能把动作顺序做完整,减少“该先做没先做、该后做提前做”的问题。
定性结果也很直观。比如狗追球、厨师切番茄、女人戴珍珠项链、准备沙拉这些例子里,单提示词常常把多个阶段揉成一团,多提示词虽然更明确,但切换点还是容易出岔子;TempAct 的优势则是把“动作推进”真正串起来了。它不是只把某一帧修得更好,而是让整段视频的叙事连续性更像人类会讲故事的方式。
Figure 5: Human preference
图6:人类偏好结果。人类评审更偏向 TempAct,说明它的改进不仅是自动指标上的“数字游戏”,也更符合直观观感。
论文还做了消融实验,证明这些设计不是“多加点组件显得热闹”。步骤提示、提示平滑、规划器 RL、执行器 RL 这几块是层层加上去的,结果也确实是一层比一层更稳。换句话说,TempAct 的收益不是靠一个神奇按钮,而是靠规划、切分、切换、奖励四件事一起协同才跑出来的。

结语与展望:从“按步就班”到“随机应变”

TempAct 给自回归视频生成补上的,不是一个更花哨的采样器,而是一个更像人类做事的组织方式:先规划,再执行;先分段,再衔接;先保证顺序,再追求画质。它的价值在于,把“复杂时间指令”从一个模糊的大难题,拆成了可以训练、可以打分、可以优化的两层问题。
不过,这类方法也不是没有代价。首先,训练成本不低:规划器、执行器、VLM 评审器、分层采样、长链路 rollout,哪一项都不算轻。其次,奖励设计和评审器质量会直接影响结果,尤其是当训练时用的评审模型和真实用户偏好不完全一致时,仍然可能出现“指标看着对,人眼觉得怪”的情况。最后,TempAct 目前更擅长的是有明确时间顺序的任务,对那些本来就没有强顺序约束的开放式视频生成,收益未必同样稳定。
但从研究方向上看,这条路是很顺的。未来如果能把规划器做得更轻、更稳,把执行器的提示切换做得更自然,再把奖励从“实验室评审”逐步迁移到更真实的用户反馈,视频生成就不只是“会画”,而是更接近“会演”。这才是交互式视频模型真正该卷的地方。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是自回归视频生成里最烦人的“顺序错乱”问题。不是画不出来,而是复杂指令下容易把前后事件搞反、搞混、搞串。

Temporal-Following Score 是什么?它是论文自己设计的时间顺序评估分数,用 VLM 去判断生成视频是否按要求完成事件顺序、状态变化、视觉一致性和文本一致性。简单说,就是专门看“有没有按剧本演”。

为什么要把规划器和执行器分开?因为“想清楚做什么”和“真的把它做出来”是两件事。规划器负责拆解时间顺序,执行器负责在自回归历史里把每一步接好,拆开以后更容易把问题定位,也更容易优化。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆
把规划器-执行器思想引入自回归视频生成,并且用分层强化学习做信用分配,思路是新鲜的,不是简单堆模块。

实验合理度:★★★★☆
有骨干模型、有时间顺序基准、有域内外评审器,还有消融实验,整体比较完整,至少不是“只挑好看的图”。

学术研究价值:★★★★☆
它把“时间指令跟随”从泛泛的感知问题,推进到可优化的规划与执行问题,对后续视频生成研究很有启发。

稳定性:★★★☆☆
思路清楚,但训练链路长、奖励依赖评审器,离“拿来就能稳定上线”还有距离。

适应性以及泛化能力:★★★☆☆
对有明确事件顺序的任务很合适,但对开放式、弱时序约束场景,收益未必同样明显。

硬件需求及成本:★★☆☆☆
32 张 H20、长训练步、分层 rollout,算力开销不低,属于“研究好看,部署先别急”的类型。

复现难度:★★★☆☆
代码开源是加分项,但涉及规划器、执行器、VLM 评估和复杂训练流程,复现门槛依然不算低。

产品化成熟度:★★★☆☆
在需要严格事件顺序的视频生成场景里有价值,但要进产品,还得补稳定性、成本和评审器一致性。

可能的问题:奖励和评审器较重,训练成本高;对开放域长视频的泛化边界还需要更多验证。


主要参考文献

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL. arXiv:2606.28016v1, 2026.
项目主页:https://jingw193.github.io/TempAct/
开源代码:https://github.com/jingw193/TempAct

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。