← 返回 PaperDaily
前沿研究
LynnReal Lab视频恢复与生成:统一多模态控制,Flash降至377毫秒
论文方法: 原生多模态视频生成与智能体视觉工作流框架 方法简称: 原生多模态视频生成框架(LynnReal-Omni) 原文标题: LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows 首次公开: 2026年9月15日(北京时间,arXiv v1) 主要
龙哥读论文
阅读 2
查看原文
论文方法:原生多模态视频生成与智能体视觉工作流框架
方法简称:原生多模态视频生成框架(LynnReal-Omni)
原文标题:LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
首次公开:2026年9月15日(北京时间,arXiv v1)
主要署名单位:论文第一署名实验室、上海创智学院、上海交通大学、复旦大学
研究领域:视频恢复与生成、多模态控制、智能体视觉工作流
原论文:https://arxiv.org/abs/2609.15863
龙哥导读
视频生成真正进入产品,不只是把画面做得漂亮,还要能听懂参考图、姿态、三维场景、游戏控制和历史片段,并在可接受时间内完成生成与解码。LynnReal-Omni尝试用一个共享模型接住这些条件,Flash版本在单张英伟达H100图形处理器上,把22帧540p视频的预热后模型计算与解码器耗时降到377毫秒。但最值得看的不是一个孤立数字,而是它怎样把“可控、长视频、修复、速度”放进同一套工程结构。
最近几个月,视频模型的演示越来越像一台“许愿机”:一句话生成电影感镜头,一张图让角色动起来,再配上同步声音。可一旦真要把它接进游戏、广告、短剧、三维设计或智能体工具,问题马上从“画得像不像”变成“能不能按我的控制稳定地画”。一个视觉智能体可能先生成角色设定图,再搭出低精度三维场景,安排镜头轨迹,写一个可操控小游戏,最后让视频模型补足材质、光影和运动细节。如果每一步都要切换不同模型、不同提示格式和不同时间坐标,系统很快就会变成接口拼盘。任何一个条件错位,角色、相机或动作都会漂。LynnReal-Omni瞄准的正是这道工程题。它不是一篇单纯的视频修复论文,也不只是追逐文生视频榜单,而是想把文本生成、图像条件、参考图控制、逐帧结构控制、编辑、长视频续写和音频放进一个原生多模态框架。视频伪影修复,是这套共享编辑能力的一个具体用法。龙哥认为,这项工作的价值不在于“一个模型包打天下”的口号,而在于它开始给不同视觉条件规定明确身份、时间和输出契约。智能体可以自由规划,但底层生成器不能靠猜:哪张图负责外观,哪段视频负责动作,哪一帧属于历史,哪些位置才是本轮需要生成的目标,都要写清楚。图1|论文首页工作流图。左侧展示图像驱动的三维场景重建,右侧展示智能体编写的低多边形游戏;提示词优化、图像生成与首帧编辑提供外观条件,视频模型再通过统一参考接口接收不同控制流。来源:论文官方全文。
一、视频生成为什么需要“原生多模态”
很多所谓统一模型,实际上只是把若干已有入口装在同一个产品页面。用户看到一个界面,后台仍可能分别调用文生视频、图生视频、姿态控制、局部编辑和续写模型。这样的组合并非没有价值,但任务之间的行为习惯、画面风格和失败方式很难保持一致。LynnReal-Omni采用共享的多模态扩散Transformer。白话说,就是文本、视频、音频、参考图、控制序列与目标帧最终进入同一个主要计算骨干,但进入前会被打上不同的“工牌”:模态标签说明它是什么,时间坐标说明它发生在何时,噪声水平说明它是干净条件还是待生成内容,输出标记说明模型应该预测哪些位置。这几个标记看起来像数据整理细节,却决定了系统是否可控。比如一张角色设定图和一段逐帧姿态视频都属于视觉输入,但前者主要约束人物外观,后者主要约束时间线上的动作。如果只把它们统称为参考图,模型就需要自己推断用途,条件一多便容易混淆。论文还给对齐控制和目标视频设置稳定的正时间偏移。可以把它理解成同一时间点的两排座位:控制帧坐在前排,待生成帧坐在后排,两者位置一一对应,但不会因为绝对坐标相同而被模型当成同一种内容。姿态、深度、编辑源视频和游戏录屏都可以沿这条时间轴提供约束。音频和视频虽然在同几次模型调用中共同推进,却使用各自的噪声时钟。原因很直观:声音与画面由不同编码器表示,干净程度和更新节奏不必相同。共享计算不等于抹平差异,真正的统一反而要保留每种模态自己的规则。在训练数据上,团队先清洗公开视频,把镜头切分为不超过一分钟的连续片段,再做场景级分组、主体关联、多模态描述和控制资产检查。每条训练单元不仅有描述文本,还要确认参考图、时间片段和目标视频来自同一来源区间,避免“提示在说甲,控制却来自乙”。这条数据链并不花哨,却很重要。视频模型经常被归因于架构创新,但多镜头连续性、人物关联和声音事件很容易被脏数据拖垮。论文没有把简单统计当作最终质量裁判,而是先用统计筛选候选,再回到具体视频判断事件是否持续、声音是否真实存在。图2|论文 Figure 2。图中依次展示任务专属的输入排列、对齐控制与目标帧的时间偏移、同一次推理中的视频与音频噪声时钟,以及长视频每轮固定一帧边界并联合解码后续帧的过程。来源:论文官方全文。
图2最值得看的是四块之间的关系。第一块回答“不同任务怎样进门”;第二块回答“控制和目标怎样对齐但不混同”;第三块回答“音画怎样共享调用却保留各自节奏”;第四块回答“长视频怎样续写而不让计算量随历史无限增长”。这是一套接口设计,而不是一个单独模块。从产品角度看,这种设计让智能体更容易编排任务。智能体可以先做三维相机运动,再把渲染结果作为逐帧控制;也可以先编辑首帧,再用游戏录屏提供运动时间线。上层工具不必为每种任务重新理解完全不同的模型语义,底层也能知道每份输入究竟负责什么。二、Flash怎么把22帧压到377毫秒
视频生成的第一大成本来自去噪骨干。标准版保留50层Transformer,并用四次网络评估完成一次样本;Flash版保留42层,只做三次评估。少一次评估并不是简单把循环次数减掉,学生模型需要通过轨迹分布匹配学习教师模型在多步过程中的变化方向。第二个动作是空间令牌压缩。Flash前两层仍处理完整序列,让文本、视频和音频先完成早期融合;随后26层对每一帧按横纵方向隔点选取视频令牌,保留大约四分之一的空间位置,同时保留边缘行列。文本和音频令牌不压缩,时间维度也不抽帧。如果直接丢掉四分之三空间位置,细节会很难回来。论文因此保留完整分辨率残差:压缩层只计算被选位置的特征更新,缺失位置用同一帧最近保留位置的更新近似,再把更新加回原始完整特征,最后14层重新在全分辨率上联合细化。这个结构的收益来自“中间大段计算变短”,而不是从头到尾都用低分辨率。注意力的成本与序列长度关系很强,前馈网络也要逐令牌计算,因此中段缩短到约四分之一视频令牌能明显降耗。论文的控制实验显示,在相同Flash权重和三次评估下,关闭令牌压缩会把骨干耗时从263毫秒增加到453毫秒。第三个动作是低精度矩阵计算与算子融合。模型把适合的投影层改成低比特权重和激活,把归一化、量化、旋转位置编码、残差更新等操作尽量合并,减少显存读写和频繁启动小计算核的开销。对视频大模型来说,数据在显存里搬来搬去,常常和真正乘加一样贵。第四个动作落在视频解码器。少步蒸馏把生成骨干加速后,原先不显眼的解码器会成为新瓶颈。团队把36层教师解码器蒸馏为26层学生解码器,保持潜变量接口、空间尺度和时间结构不变,因此上游生成模型不需要重新定义输出格式。学生解码器同时学习教师重建、像素误差、时间差分、内部特征和重新编码后的一致性。训练数据既包含真实视频编码出的潜变量,也包含生成模型实际产生的潜变量。后者很关键:解码器如果只见过真实数据的潜空间,接到生成模型略有偏移的输出时可能失真。在完全加速配置中,系统还使用自适应分块、图形处理器端颜色转换和解码器编译。表格中的377毫秒,是22帧、540p、单张H100、两次预热后十次测量的合并中位数,具体指三次Flash骨干计算加视频解码器。包含调度、音频解码、颜色转换和传输的生成墙钟时间是479毫秒。这两个数字必须分开。377毫秒适合作为模型与视频解码核心路径的标题数字;479毫秒更接近当前代码中的热启动生成调用。两者都不包含文本与参考条件编码、模型加载、文件编码、首次形状编译,也不是用户按下按钮到屏幕显示结果的完整延迟。标准版在同一540p、22帧设置下,模型加视频解码为843毫秒,生成墙钟为959毫秒;Flash分别是377毫秒和479毫秒。峰值显存从53.9吉字节降到46.4吉字节。速度和显存都明显改善,但标准版与Flash是分别训练的模型,不能把全部差距归因于某一个单独技巧。分辨率和时长一上去,数字会迅速变化。768p、5秒时,Flash完整生成约7.661秒;10秒约20.763秒;15秒约40.362秒。也就是说,540p短片的热启动核心计算很快,不等于768p长视频已经实时。论文把这些设置分表报告,是一个值得肯定的做法。三、长视频不是无限塞历史,而是保留“够用的记忆”
视频越长,最自然的想法是把所有历史帧都交给模型。可历史长度不断增加,注意力计算和显存也会持续增长,最终无法稳定部署。LynnReal-Omni采用固定长度分块续写:每轮生成17张新画面,并复用上一段最后一张红绿蓝画面作为边界。边界帧会以红绿蓝颜色编码技术(RGB)的形式单独编码,放在下一段目标的第一个潜变量位置,后面跟五个未来潜变量。模型把边界和未来一起解码,再删除重复边界,交付17张新帧。这里“联合解码”比先单独解边界、再拼未来片段更重要,因为视频解码器需要看到相邻时间上下文。历史记忆采用固定预算。最早的一张潜变量帧保留完整空间分辨率,最近两张按二倍空间步长采样,更早的最多八张按四倍步长采样。无论视频继续多长,历史令牌总量不超过约两张完整潜变量帧的规模。这套设计像做会议纪要:开场决定主题,需要完整保存;最近讨论影响下一步,要保留较多细节;中间过程只留关键摘要。它未必能记住所有细小物体的长期变化,但计算成本不会因为视频变长而无限上升。存储同样有上限。容量满后,系统保留初始帧和最近帧,丢弃中间条目。论文的出发点不是宣称彻底解决长期一致性,而是把“历史记忆”变成可部署的固定接口。真正困难的角色身份漂移、复杂物体状态和多镜头叙事,仍需要更长轨迹评估。这也呼应龙哥最近反复关注的一条工程判断:任务驱动的状态记忆,往往比无差别扩展上下文更有价值。前提是系统清楚什么必须长期保存、什么只需短期精细、什么可以压缩。否则所谓长上下文只是把成本向后推。四、智能体怎样提供可检查的视觉控制
纯文本很难准确描述复杂镜头。比如“相机绕过布料,看见后面的物体”,文字说得再长,也未必能固定遮挡关系与视差。智能体可以先搭一个低精度三维场景,设置相机轨迹、物体位置和遮挡,再把渲染序列交给视频模型补充材质与真实感。游戏控制也是类似思路。智能体写出一个低多边形小游戏,让角色移动、碰撞和相机跟随在可执行环境里发生;视频模型接收游戏录屏作为时间控制,再用首帧编辑或参考图改变角色外观与整体风格。运动来自程序,视觉质感来自生成模型。这种组合的好处是可检查。三维场景可以旋转查看,游戏逻辑可以运行,镜头轨迹和碰撞规则能被修改。生成结果如果失败,团队至少能区分问题来自控制源、参考外观还是视频渲染,而不是只能反复改一段长提示词。但图1展示的是工作流概念和开发案例,不等于已经实现从自然语言到完整影视成片的全自动流水线。论文明确提醒,细致几何、材质、绑定、动画和渲染仍有生产成本;更强的智能体并不会自动消除这些成本。游戏控制案例使用四次去噪评估,展示录屏与动漫风格生成在匹配时间点上的运动关系。它没有测量真实玩家输入到屏幕显示的延迟,所以不能把540p短片的热启动耗时直接换算为“实时可玩的生成式游戏”。这就是论文里“智能体视觉工作流”最合理的理解:它是控制源与生成器的组合接口,而不是一个已经包办创意、建模、交互、生成和交付的超级应用。对团队而言,可复用的部分是条件合同与分层调试方式。五、视频伪影修复:能做,但别把它写成通用恢复冠军
论文提供了一个很吸睛的蜡烛视频修复案例。原生成视频存在亮点、背景网格和竖向渲染伪影。系统把每一张源帧交给共享图像编辑接口,根据“去除伪影、保留蜡烛与火焰”的指令独立生成,再按原时间戳顺序重新组成视频。每张源帧的编辑会产生一个22帧内部短片,配置选择其中最后一帧作为修复结果。120张源帧各做四次去噪评估,总计480次。所有帧使用同一个随机种子,输出画布为1344×768,没有额外外观参考、时序插值、反馈回路或后处理恢复滤镜。图3|论文 Figure 4。上排是含背景网格、亮点和竖向伪影的生成视频帧,下排是在相同时间戳独立编辑后的结果;该120帧案例共进行480次去噪评估。来源:论文官方全文。
从完整120帧的检查结果看,背景网格和亮点明显减少,火焰仍随时间变化。与此同时,小幅亮度与形状波动仍存在,偶尔还有残留亮点,火焰高度变化也比源视频更小。换句话说,它确实展示了可用的指令式清理能力,但没有把时间一致性彻底解决。关键原因是每帧独立。系统保留了原始顺序和播放时间,却没有显式跨帧约束。相同随机种子有助于减少一部分随机差异,但不能保证火焰形状、亮度和细节在相邻帧之间严格连续。逐帧图像编辑与真正的视频恢复网络,仍是两种不同技术路线。这个实验也没有干净真值。我们不知道理想的蜡烛视频每个像素应该是什么,因此只能观察伪影是否减少、主体是否大体保留,不能计算标准恢复指标。案例数量只有一个,也没有跨场景统计。所以更准确的说法是:LynnReal-Omni把共享生成模型复用成了视频伪影清理器,验证了“生成模型能否按指令逐帧修复自身或其他生成结果”这条思路。它还没有证明在真实拍摄噪声、压缩损伤、去模糊、超分辨率或老片修复上领先。对视频恢复研究者,这个案例仍值得关注。它提供了一条低门槛基线:不额外训练场景专用恢复网络,先利用统一编辑模型处理每帧,再逐步加入光流、特征传播、时序注意力或结果反馈。真正的研究空间,恰好在图3尚未解决的帧间稳定性。六、评测不只看画质:100个提示、六类能力
为评估多镜头音视频生成,论文提出多模态音视频物理评测框架(MSAVP)。它包含100个提示,其中既有单镜头,也有要求二到六个镜头的任务;最终报告20项指标,并归入提示遵循、事件执行、视觉质量、多镜头一致性、世界合理性和音频对齐六个能力族。这里最值得肯定的是拆分。一个模型可以画面漂亮却没执行动作,可以听懂物体却把声音放错时间,也可以单镜头很好看但切镜后角色变脸。如果只给一个总分,失败会被其他维度平均掉。论文先在每个能力族内部平均,再对六族等权平均。文字生成视频方面,Seedance 2.0总分79.39,另一套对比系统为79.27,LynnReal-Omni为77.76。图像生成视频方面,最好对比系统为80.65,LynnReal-Omni为79.20。该模型并不是表格总分第一。它在图像生成视频的提示遵循达到86.55,事件执行达到74.73,都是该表最高;世界合理性89.52,多镜头一致性81.81,说明低延迟路线没有把所有控制能力都牺牲掉。但视觉质量61.16、音频81.44和总分仍落后于该模式的最好系统。图4|论文 MSAVP 雷达图。左侧为文字生成视频,右侧为图像生成视频,展示20项指标;径向坐标从20开始以放大高分区差异,低于20的值会落在中心。来源:论文官方全文。
图4不能只看哪条线“面积最大”。有些轴衡量提示与实体是否匹配,有些轴衡量动作绑定、镜头切换、世界状态、材质行为和声音时间。对智能体工作流而言,某一个决定任务成败的窄轴,可能比平均总分更重要。评测主要由模型裁判配合专门测量工具完成。论文把镜头切分和图像质量等工具当作观察证据,而不是让工具替代对互动过程的判断,也记录了不适用指标的样本数量。不过作者仍提出后续需要补充人工一致性验证。这意味着当前分数适合比较同一协议下的系统表现,不宜被当作人类审美和物理真实性的最终答案。尤其当被评模型与裁判模型共享某些偏好时,自动评分可能高估语言描述上的“看起来合理”。龙哥更关注的是评测思路:生成视频进入智能体以后,评价对象不再只是“一段成片”,而是一个执行结果。提示有没有完成、实体有没有绑对、镜头切换后状态有没有延续、声音有没有在正确时刻出现,这些才接近产品验收。七、和两条相似路线相比,它补的是哪一环
候选检索中,与这项工作最接近的两条路线,是统一视频生成与编辑框架(VACE)和长视频生成方法(LongLive)。前者把参考条件、编辑源和多种控制放进共享框架,重点是任务统一。LynnReal-Omni沿着这条路继续向音视频、智能体控制源和部署加速扩展。长视频生成方法更关注持续生成,核心挑战是历史信息怎样压缩、片段怎样衔接、长期身份和运动怎样维持。LynnReal-Omni的固定边界帧与有界历史也在回答类似问题,但它把长视频作为原生多模态系统中的一种任务,而不是唯一主线。三者放在一起看,视频生成正在从“一个提示出一段视频”转向“一个系统处理多种条件、持续状态与工具调用”。统一编辑路线解决条件语言,长视频路线深入持续续写,LynnReal-Omni则强调智能体可以提供三维与游戏控制,并把加速后的解码瓶颈单独处理。它的短板也因此更清楚:任务面很宽,单项结论需要分别验收。短片速度不能替代长视频吞吐;逐帧修复案例不能替代恢复基准;三维控制案例不能替代几何准确性;自动裁判总分不能替代人工体验。统一系统最怕用一个亮点替整条链路背书。真正值得复用的不是“再做一个大全模型”,而是给每一层建立可执行合同:输入条件是谁、时间怎样对齐、历史保存多少、输出验收什么、延迟在哪一段产生。这比简单增加一个任务头更接近产品工程。八、谁最值得读,谁要保持克制
如果你在做视频生成平台,这篇论文值得重点看方法与延迟章节。它把骨干、注意力、量化、颜色转换和视频解码器分别计时,展示瓶颈如何随着少步生成发生转移。很多团队只优化主模型,最后却发现解码、数据搬运和请求编排占掉大部分时间。如果你在做视觉智能体,最值得看的是输入契约。参考图、逐帧控制、三维渲染、游戏录屏和历史片段不应只是若干文件路径,而要带着用途、时间坐标和目标选择进入模型。上层规划越灵活,底层接口越需要严格。如果你在做视频恢复,可以把蜡烛案例当作生成式逐帧编辑基线,而不是通用恢复结论。下一步应加入多场景有真值数据、标准指标和显式时序机制,并检查修复是否改变主体结构、运动幅度与光照规律。如果你是普通内容创作者,377毫秒也不要直接理解成“半秒生成任意高清视频”。它对应540p、22帧、热启动、单张高端数据中心图形处理器,而且核心模型加解码之外还有调度和其他环节。768p长视频目前仍以秒到分钟计。论文列出了代码、标准版与Flash版模型、轻量视频解码器和演示资源,但本文没有把“论文中列出”写成“完整系统已经独立复现”。对准备部署的团队,仍需逐项确认权重、推理代码、复杂条件组件、内核编译和服务依赖是否齐全。龙哥最后的判断是:LynnReal-Omni不是靠单一榜单夺冠吸引人,而是把视频模型从“生成一次”往“被智能体反复调用的视觉渲染器”推进了一步。它最强的地方是系统结构和工程拆分;最需要继续补的是人工评测、长轨迹稳定性、真实交互延迟和修复统计。对于研究者,别只盯着更大的生成模型,可以顺着论文继续追三个问题:多种控制在同一模型里会不会互相干扰?有界历史怎样保留真正决定任务的状态?当去噪只剩三四步,视频解码、数据搬运与服务调度还能怎样一起优化?这些问题比一个更漂亮的短片更接近下一轮竞争。对于产品团队,也不必等“万能世界模型”成熟才行动。先把任务拆成可检查控制源,让智能体输出三维场景、关键帧、姿态或程序化录屏,再用生成模型负责外观与细节;每层分别验收,失败时能定位,成本也更容易估算。龙迷三问
第一问:如果一个视频模型能接收文本、参考图、三维渲染和游戏录屏,你最希望它先进入哪个真实工作流:广告分镜、短剧预演、游戏内容、工业仿真,还是视频修复?为什么?第二问:对生成式视频产品,你更在意540p短片的亚秒级热启动,还是768p长视频的稳定身份与物理一致性?团队应该怎样分配算力和研发预算?第三问:逐帧图像编辑已经能减少明显伪影,但没有显式时间约束。你会优先增加光流、跨帧注意力、三维一致性,还是让智能体检测失败后自动返工?本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。
本文为论文解读,实验设置、数值与技术细节以原论文及其后续版本为准。
