← 返回 PaperDaily
视觉与图像
阿里Wan-Streamer新解:视频就是世界加事件流
这篇论文最有意思的地方,不是又堆了一个更大的流式模型,而是把“视频”重新解释成了“世界 + 事件流”。这个视角一换,预训练目标、交互形式、行为控制,全都顺了。
龙哥读论文
发布于 2026-08-14 09:11:16
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,不是又堆了一个更大的流式模型,而是把“视频”重新解释成了“世界 + 事件流”。这个视角一换,预训练目标、交互形式、行为控制,全都顺了。
原论文信息如下:
这篇论文最有意思的地方,不是再把“流式视频模型”做大一圈,而是先把问题重新讲明白:视频并不是一串孤立帧,而是“世界”加上“事件流” 。这个说法听起来像一句哲学味很重的总结,实际却很工程:一旦把“稳定不变的上下文”和“持续变化的内容”分开,预训练目标、交互方式、行为控制,都会突然顺很多。
Wan-Streamer v0.3 的核心判断很朴素:世界是持久背景,事件流是时间里的变化 。世界包含环境、场景、主体身份、外观、环境声、音色等相对稳定的信息;事件流则是行为、说话、镜头运动、场景变化、其他声音等会随时间推进的内容。换句话说,视频不是“每一帧都从零开始”,而是在一个已经存在的世界里,事件一件一件发生。
这个视角的好处在于,模型不必把所有信息都塞进同一个“黑箱时间轴”里硬猜。它先记住世界,再预测事件怎么展开。于是,训练目标就从“猜下一个片段”升级成了“给定世界和输入,预测世界如何实时向前流动 ”。这就像看一部剧:背景布景、角色设定、环境氛围是世界,台词、动作、镜头切换是事件。只盯着台词猜剧情,当然容易翻车;先理解剧组搭好的世界,才更像真正会“看视频”。
论文不是把“世界+事件流”当作一句漂亮口号,而是直接把它变成了一个可训练的预训练任务。训练数据来自大量真实视频,每个样本都被整理成两部分:一部分是持续存在的世界上下文,另一部分是带时间对齐的事件描述。事件可以是行为,也可以是说话,还可以是环境变化、镜头动作、声音事件。原文图1把这个过程讲得很直观:一边是世界,一边是按时间发生的事件,像把视频拆成“背景板”和“剧情条”。
这里的关键不是“标注得多细”,而是它把原本只服务于单一交互任务的模型,改造成了一个通用的世界事件学习器 。论文明确指出,这种能力不只可以服务于实时音视频交互,也可以迁移到世界模型控制、第一人称交互、机器人操作等任务。也就是说,训练目标不再只是“让机器人会聊天”,而是“让模型学会世界里事情通常怎么发生”。这就比单点应用更像基础能力了。
论文这里还有个很实用的工程判断:现实视频几乎都能看成“一个世界 + 一串变化”。因此这种监督信号天然大、天然广,不需要为每个下游任务重新造一套数据格式。对工业界来说,这种思路很省心:少做一堆脆弱的任务专用管线,多做一个能理解世界演化规律的底座,后面再按场景去适配。
为了让这个想法不止停留在“讲故事”,论文给出了形式化定义。世界 W 是一个灵活的结构化记录,里面可以包含视觉环境、布局、风格、音频背景、角色身份与外观等信息;事件 ek 则是一个时间局部记录,包含事件持续区间、自由文本描述,以及它对应的角色或“无角色”标记。
如果把这个结构翻成大白话,就是:世界负责“这是什么地方、谁在这里、环境什么样” ,事件负责“接下来发生了什么”。这样一来,模型在推理时就不用每一步都重新理解全部背景,只要先把世界预填好,后续按时间流处理事件即可。论文把这称为世界-事件因子分解,本质上是把“长期上下文”和“短期变化”拆开建模。
原文中还给出了流式因子分解的表达方式:模型在每个流式单位上,根据世界和输入历史去预测下一段事件。这里的 K 表示流式单元个数,x≤k 表示驱动流的输入历史。对预训练来说,输入是过去观察到的视频;对交互来说,输入是用户持续送进来的文本、音频和视频。这个分解并不炫技,但很关键,因为它让“世界”成为一次性条件,而不是每个时间步都重复塞进去,减少了冗余,也更符合实时系统的部署逻辑。
如果说以前很多流式模型更像“边看边猜下一秒”,那这篇论文更像“先搭好舞台,再让演员按剧本即兴发挥”。舞台搭好后,后面的表演才有条件做到稳定、同步、可控。
这篇工作最值得注意的地方,是它没有为了“更会演”把实时性搞崩。Wan-Streamer v0.3 仍然保持了 v0.2 的部署节奏:640×368 分辨率、25 FPS、160 毫秒流式单元、约 200 毫秒模型侧响应时延、约 550 毫秒总交互时延 。这说明它不是实验室里“看起来很强”的慢模型,而是有明确工程边界的流式系统。
架构上,世界上下文会先被一次性预填充,然后语言、音频、视频输入输出共享同一条因果时间线,由 block-causal attention 统一协调。这个设计的直觉很简单:先把“场景设定”定住,再让后续事件按时间流式生成 。这样做的好处是,模型不用每一轮都重新理解“我是谁、我在哪、周围是什么”,而是把算力集中在真正变化的部分。
原文图2把这个流程画得很清楚:世界上下文先进入系统,之后用户的多模态输入沿着因果链进入模型,模型输出的语言形式动作再去条件化同步的音视频生成。这个链条的关键是“动作先语言化”,也就是先生成可读的语言式行为,再交给后端去渲染成动作、表情、姿态和声音。对实时系统来说,这比单独搭一套动作控制器更干净,也更容易保持时序一致。
v0.3 最明显的升级,不是“说得更像人”,而是“能说,还能演 ”。论文采用了角色扮演式聊天格式:括号外是说话内容,括号内是行为指令,比如“(皱眉) 你刚才说什么?”或者“(拿起杯子并朝窗外看) 好的,稍等一下。”这里的行为不是固定动作表,而是开放词汇的自然语言描述,想怎么写就怎么写,只要能被语言表达出来。
这点很重要。以前不少交互系统的动作空间很窄,常见就是几个离散操作,像导航里的 w/a/s/d,或者几个固定表情。问题是现实交互根本不这么干净:人会转头、会伸手、会停顿、会看向某个物体、会边说边做。Wan-Streamer v0.3 的思路是把这些动作写成语言,再把语言动作和说话内容放进同一个流里学习。这样做的结果就是,模型的行为边界被明显拓宽了,而且不需要额外引入一个复杂的动作控制器。
论文给出的直观例子也很接地气:模型可以在对话时做出表情、姿态变化、回应声音、与附近物体交互等动作,而且这些动作会与语音同步。也就是说,它不是先说完再补动作,也不是动作和语音各干各的,而是把“说”和“做”一起编进了一条事件流。这个设计对于沉浸式客服、陪伴型角色、虚拟主播、实时数字人都很有吸引力,因为这些场景最怕的就是“嘴在说,身体还在上一句”。
看到这里,确实会有一种“哎呦,不错哦”的感觉:不是因为它把动作做得多花哨,而是因为它把行为生成这件事,放回了语言能统一表达的轨道里。对大模型系统来说,统一表达往往比堆更多分支更稳。
如果把三代模型连起来看,v0.1 解决的是“实时全双工音视频交互怎么端到端建模”,v0.2 解决的是“同样延迟下怎么把分辨率拉高”,v0.3 则进一步追问“底层能力到底是什么”。答案就是这次提出的世界-事件分解。表1把三代变化总结得很清楚:v0.3 改的是认知框架,不改的是实时系统的骨架 。
这也是这篇论文最聪明的地方。很多工作一升级就喜欢把系统推倒重来,结果指标没涨多少,复杂度先爆炸。Wan-Streamer v0.3 没这么干,它沿用了 v0.2 的 serving topology,也保留了相同的时延预算,只是在训练任务和行为表达上做了更抽象、更通用的上层重构。说白了,就是底盘不动,换了更会开车的驾驶逻辑。
论文最后给出的结论也比较克制:v0.3 证明了“世界 + 事件流”可以作为一个统一视角来组织实时生成和交互,但它并没有声称已经把所有下游任务都做满。相反,作者明确提到,世界建模、漫游、机器人控制等方向只是可以迁移的候选场景,系统化适配和评估还留给后续工作。这个态度是对的,毕竟把概念讲通,不等于把所有场景都打穿。
Wan-Streamer v0.3 的价值,不在于把“流式交互”再说一遍,而在于给它补上了一个更稳的理论支点:视频可以被理解为世界与事件的组合 。这个支点让模型既能做通用预训练,又能落到实时交互,还能把开放词汇行为纳入同一条生成链路。对产业来说,这意味着未来的数字人、陪伴体、在线演示、实时导览,可能不再只是“会说话的头像”,而是“有世界感的互动体”。
但也要看到边界:开放词汇行为越自由,越依赖世界上下文是否足够准确;一旦世界建模出错,后面的动作和表情就可能“演得很认真,但方向全错”。此外,实时系统对时延、稳定性、部署成本都很敏感,论文虽然保住了 200 毫秒级模型侧响应,但真正大规模落地时,网络波动、端侧算力、音视频同步质量,仍然是绕不过去的硬问题。
所以,这篇工作最值得借鉴的,不是“再堆一个更大模型”,而是“先把任务的世界观讲清楚”。很多系统之所以越做越乱,往往不是模型不够大,而是问题本身没被拆对。Wan-Streamer v0.3 的启发就在这里:当一个视频系统开始认真区分世界和事件,很多原本缠在一起的麻烦,才有机会被拆开。
龙迷三问
这篇论文到底解决了什么问题? 它解决的不是“怎么把视频做得更清晰”这么单一的问题,而是把实时流式视频交互重新定义成“世界 + 事件流”的建模问题。这样一来,模型既能学通用视频预训练,也能落到实时全双工音视频交互,并支持开放词汇行为。
“世界”和“事件流”分别是什么意思? 世界是相对稳定的背景信息,比如场景、环境、角色身份、外观、音色和环境声;事件流是时间中不断变化的内容,比如动作、说话、镜头移动、场景变化和其他声音。前者负责“设定”,后者负责“推进剧情”。
开放词汇行为为什么重要? 因为真实交互里,动作不可能只有几个固定按钮。开放词汇行为允许模型用自然语言描述动作,比如“转身”“拿起杯子”“皱眉”“看向窗外”,再把这些语言动作同步成视频和音频,表达力明显比固定动作集更强。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“视频=世界+事件流”这件事讲成了一个统一框架,不只是概念新,还是能落到预训练和实时交互里的新。
实验合理度: ★★★☆☆
时延指标沿用前代设置,说明比较口径是稳定的;但本篇更偏框架升级,实验展示仍以定性和系统指标为主,量化说服力不算特别强。
学术研究价值: ★★★★☆
对视频生成、世界模型、实时交互三条线都有启发,尤其是把“持久上下文”和“动态事件”拆开,研究味道是够的。
稳定性: ★★★☆☆
保住了原有低延迟骨架,工程上不算飘;但开放词汇行为一多,稳定性就会更依赖世界理解是否准确。
适应性以及泛化能力: ★★★★☆
世界-事件分解天然适合迁移到多种实时任务,泛化潜力不错;真正能不能跨场景稳定工作,还要看后续系统化验证。
硬件需求及成本: ★★★☆☆
推理时延控制得不错,但 640×368、25 FPS 的实时流式生成仍然不是轻量活,端侧成本和服务成本都不会低。
复现难度: ★★☆☆☆
项目有网站,但完整训练和系统复现门槛仍然高,尤其是数据、流式系统和低延迟部署都不算简单。
产品化成熟度: ★★★☆☆
已经接近可演示、可试点的状态,适合数字人、实时交互、展示型场景;但要进大规模生产环境,还要补鲁棒性、成本和安全边界。
可能的问题: 框架很顺,但量化结果偏少;开放词汇行为很灵活,也意味着错误行为更难约束,顶会视角下还需要更强的定量证据。
主要参考文献
[1] Lianghua Huang, Zhi-Fan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, and Zoubin Bi. Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models, June 2026. https://arxiv.org/abs/2606.25041.
[2] Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, and Zoubin Bi. Wan-Streamer v0.2: Higher Resolution, Same Latency, July 2026. https://arxiv.org/abs/2607.04443.
[3] Sam Ade Jacobs, Masahiro Tanaka, Chengming Zhang, Minjia Zhang, Shuaiwen Leon Song, Samyam Rajbhandari, and Yuxiong He. Deepspeed Ulysses: System optimizations for enabling training of extreme long sequence transformer models. arXiv:2309.14509, 2023.
[4] Wan-Streamer official website: https://wan-streamer.com/
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群