← 返回 PaperDaily
视觉与图像
语义token+扩散渲染:Vega新范式
视频理解和视频生成长期像两拨人:一边要“看懂”,一边要“画准”。Vega直接把两件事塞进同一个框架里,还用3B参数在多个基准上打出了很能打的成绩,值得细看。
龙哥读论文
发布于 2026-08-14 21:47:08
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 视频理解和视频生成长期像两拨人:一边要“看懂”,一边要“画准”。Vega直接把两件事塞进同一个框架里,还用3B参数在多个基准上打出了很能打的成绩,值得细看。
原论文信息如下:
统一理解与生成:Vega如何用一个框架搞定视频?
视频这东西,最烦的地方就在于它很“贪心”:既要看懂内容,又要会把内容生成出来。只会理解的模型,像个很会做阅读理解的学生,看到视频能答题,但让它画出来就开始卡壳;只会生成的模型,又像手艺不错的画师,画面挺顺,但问它“这段视频里发生了什么”,它就容易装糊涂。Vega想做的事很直接:把这两拨人塞进同一个框架里 ,让视频理解和视频生成不再各玩各的。
这篇论文的关键判断很有意思:视频比图像更适合做统一建模 。原因不玄学,视频天然带着时序和因果结构,不只是“这一帧长什么样”,还包含“前一秒发生了什么、后一秒为什么会这样”。所以作者没有继续沿着“图像统一模型”的老路硬搬,而是直接把视频作为统一多模态建模的主战场。
Vega的思路可以先用人话概括成一句:先用语义化的离散token把视频“压缩成能思考的样子”,再用扩散解码器把它“画回去” 。理解任务要的是紧凑、可判别的语义,生成任务要的是细节、连贯和画质。两者需求不一样,Vega没有强行让一个模块干所有活,而是让AR模型负责“想明白”,让扩散模块负责“画清楚”。
告别割裂:从像素到语义,Vega的混合架构解密
Vega的整体结构不是简单拼接,而是一个很明确的分工体系。论文里有两个关键词必须先解释清楚:AR 和扩散 。AR是“autoregressive”的缩写,中文一般叫自回归 ,意思是模型按顺序一个token接一个token地预测;扩散则是逐步去噪生成高质量图像或视频的常见路线。Vega把前者放在语义空间里做预测,把后者放在像素空间里做渲染,这个分工很像先写提纲再润色成稿,逻辑上更顺。
这里最值得注意的是视觉token不是像素token,而是语义token 。论文采用的是语义特征空间里的token化方法,而不是传统VQ-VAE那种更偏像素压缩的做法。直白点说,传统方法更像把视频拆成一堆“像素碎片”,数量大、冗余高;Vega更像先把画面提炼成“语义摘要”,token更少,但更接近真正要理解的内容。这样做的好处很现实:token少了,计算就省了;语义浓了,理解和生成之间的鸿沟也小了 。
生成路径上,Vega先均匀采样视频中的关键帧,让AR模型预测这些关键帧的语义token,再把这些token喂给扩散解码器去补细节。这个设计的本质是:AR模型负责“决定故事骨架”,扩散模型负责“把骨架长成肉” 。这样既保留了自回归建模的结构化优势,又避免了直接在像素空间做AR时,token爆炸、时序冗余太重的问题。
论文里还有一个很实用的技巧叫噪声控制视觉条件 。它的核心是:不同视频任务对条件帧的依赖程度不一样。文本生成视频时,所有帧都按标准噪声训练;图像生成视频或视频续写时,参考帧不加噪声,其他帧仍按扩散噪声流程走。这个机制的作用很朴素:该保留的参考信息保留下来,该随机的部分继续随机,避免模型把参考帧也“洗糊了”。
双流选择与视觉监督:让视频理解更高效、更聪明
如果说生成侧是“把视频画出来”,那理解侧就是“把视频看明白”。但视频理解最大的麻烦不是“看不懂”,而是“帧太多,token太贵”。Vega这里用了一个很聪明的办法:双流选择 。这个名字听起来挺学术,意思其实不复杂:把视频分成两种信息流,一种抓关键剧情节点,一种抓细节补充信息。
论文把视频看成由多个连续“剧情段”组成。每段的起始帧被当作pivot frame ,也就是“主锚点”;pivot之间采样的帧叫detail frame ,负责补足动作变化和上下文。pivot流采用较小的token池化尺度,尽量保住关键语义;detail流采用更大的压缩尺度,牺牲一点分辨率换来更低的token开销。这个思路很像做会议纪要:主标题不能丢,细节可以压缩,但不能压到完全看不出来。
更妙的是,Vega没有只靠理解任务本身的监督来训练视觉token,而是额外加了一个视觉监督 。做法有点像掩码自编码:先把一部分视觉token遮住,再让模型根据上下文去补回来。这个辅助任务的意义不只是“多一个损失函数”,而是逼着模型把视觉token学得更像真正的语义表示,而不是只会给语言模型打辅助。
这里还引入了一个论文里很重要的缩写:MLLM ,即多模态大语言模型 (Multimodal Large Language Model)。Vega并不是简单把一个冻结的MLLM拿来当理解外挂,而是让视觉和语言在同一套离散token空间里一起学。这个区别很关键:前者像“借个翻译器”,后者更像“让两门语言在同一个班里一起上课”。
3B参数挑战7B模型:Vega在多个基准上的惊艳表现
实验部分最能看出这套设计到底是不是“纸面漂亮”。先看生成任务,Vega在VBench和VBench++上都拿到了很强的成绩,尤其是在统一模型里非常扎眼。这里的重点不只是分数,而是它用3B参数,去和一堆7B、13B甚至30B模型同台打擂 ,还能保持相当有竞争力的表现,这个参数效率确实有点东西。
更值得注意的是理解任务。视频理解这边,Vega在VideoMME、MLVU、LongVideoBench、NextQA和EgoSchema上都给出了比较稳的结果。和很多只做理解的模型相比,它的参数量更小;和很多统一模型相比,它没有因为“既要又要”而明显掉队。尤其是VideoMME和LongVideoBench上的提升,说明双流选择和视觉监督确实不是花架子,而是在长视频场景里帮模型少走了不少弯路。
更细一点看消融实验,Vega的几个设计都不是“可有可无”。先说扩散解码器的条件输入:视觉条件明显比纯文本条件更强,视觉+文本一起用并没有继续显著变强,反而略弱一些。这说明视频生成里,视觉条件本身就已经足够富有表达力 ,文本更像补充说明,而不是主引擎。
再看视频理解的消融,双流选择一加,指标就有稳定提升;再加上生成监督,提升更明显,尤其在NextQA上非常突出。这个结果很能说明问题:生成任务并不是理解任务的旁支,反而能反过来给理解提供额外监督 。换句话说,模型如果既要会“说”,又要会“画”,在某些场景下反而更容易学到更完整的视觉语义。
噪声控制条件:一个技巧让图像到视频生成稳定又连贯
图像到视频这类任务最怕什么?不是不会生成,而是“第一帧像,后面全跑偏”。Vega的噪声控制条件正是冲着这个痛点来的。它不是粗暴地把参考图塞进去完事,而是用噪声掩码精细控制哪些帧保留条件、哪些帧继续随机扩散,从而让参考信息既能稳住语义,又不会把后续运动空间锁死。
这种设计的巧处在于,它把不同生成任务统一到同一套训练逻辑里:文本生成视频时,所有帧都参与标准扩散;图像生成视频时,条件帧不加噪声,其他帧照常去噪。这样一来,模型不需要为不同任务单独搭两套流程,工程上更干净,训练上也更一致。对真正要落地的人来说,这种“统一接口”比单点花活更值钱。
总结与展望:视频模型统一化的新起点
Vega这篇工作最有价值的地方,不是单纯把视频理解和生成“放在一起”,而是把两者放进了一个共享语义空间 里,让它们真正互相供血。理解侧通过双流选择和视觉监督学得更稳,生成侧通过语义token和扩散渲染变得更高效。它传递出的信号很明确:视频统一建模不是把模块堆满,而是要找到“理解”和“生成”共同依赖的中间表示。
不过,这条路也不是没有代价。统一框架通常意味着系统更复杂,训练链路更长,工程调参也更麻烦;语义token压缩得越狠,越可能损失细粒度外观细节;扩散解码器虽然补细节强,但推理成本和速度仍然不算轻。换句话说,Vega证明了统一是可行的,但要把它真正塞进产品里,仍然得继续解决速度、成本和稳定性这三道老题。
如果把这篇论文放到更大的趋势里看,它其实在回答一个很现实的问题:未来的视频基础模型,可能不会只分成“理解模型”和“生成模型”两条线,而是更像一个统一的大脑,既能看、能说,也能画。Vega还只是起点,但这个方向已经很清楚了。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“视频理解”和“视频生成”长期割裂的问题。Vega不是只做其中一个,而是用共享token空间、自回归语义预测和扩散渲染,把两类任务统一到一个框架里。
文中的pivot frame、detail frame是什么意思? pivot frame是每个视频剧情段的关键帧,负责抓主语义;detail frame是在pivot之间采样的补充帧,负责提供细节和动态信息。两者配合,既省token,又不容易漏掉重要内容。
为什么视觉token比文本条件更适合视频生成? 因为视频生成本质上更依赖画面结构和时序连续性,而视觉token本身就携带了更丰富、更细粒度的空间信息。文本当然有用,但更多是描述层面的约束,不能替代视觉条件对画面细节的直接控制。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆ 统一视频理解与生成的方向不新鲜,但Vega把“语义token共享 + 自回归预测关键帧 + 扩散渲染 + 双流理解”串成了一套完整闭环,组合创新是成立的。
实验合理度: ★★★★☆ 对比覆盖了生成和理解两条线,消融也能对应到核心设计,逻辑比较顺;不过统一模型和专用大模型之间的公平性,仍然受训练数据与系统复杂度影响。
学术研究价值: ★★★★☆ 这篇工作真正有价值的地方在于证明了视频统一建模不是空话,尤其对“理解与生成共享表示”这个方向有明确启发。
稳定性: ★★★☆☆ 生成质量和理解性能都不错,但扩散解码器和多阶段训练让整体链路偏重,离“直接上生产”还有一段距离。
适应性以及泛化能力: ★★★★☆ 从文本到视频、图像到视频、视频理解都能覆盖,适应面不窄;但面对更复杂长视频和更极端场景,仍需更多验证。
硬件需求及成本: ★★☆☆☆ 3B参数不算夸张,但训练和推理里还叠着扩散模块,成本并不轻松,想低配硬跑不现实。
复现难度: ★★★☆☆ 思路清楚,但多模块联合训练、数据混合和推理配置都不算简单,复现门槛中等偏上。
产品化成熟度: ★★★☆☆ 适合做研究原型和能力展示,若要进入产品,还要继续压缩推理成本、提升稳定性和控制延迟。
可能的问题: 统一框架很漂亮,但训练链路长、推理成本高,且语义压缩与细节保真之间仍有天然矛盾,落地时别只看分数。
主要参考文献
[1] Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo. Bridging Video Understanding and Generation in a Unified Framework. arXiv:2606.31326v1, 2026.
[2] 论文中引用的相关工作包括 VBench、VideoMME、TATok、Wan2.1、Qwen2.5 等,具体见原文参考文献部分。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群