← 返回 PaperDaily 大模型与智能体

无蜂窝+FIM:0.4dB到15.8dB的40倍跨越

机器人学数据就像人类学做饭——光看不练不行,但真去采数据又贵又慢。华为这篇CVPR 2026工作VideoWeaver,直接把多视角演示视频"一键换肤":深度图加草图当控制信号,4D点云把不同视角的潜空间钉在同一坐标系里,跨视角风格终于不再各说各话。8张昇腾910B训一周,11B参数,效果还压过14B的VACE。

龙哥推荐理由:
机器人学数据就像人类学做饭——光看不练不行,但真去采数据又贵又慢。华为这篇CVPR 2026工作VideoWeaver,直接把多视角演示视频"一键换肤":深度图加草图当控制信号,4D点云把不同视角的潜空间钉在同一坐标系里,跨视角风格终于不再各说各话。8张昇腾910B训一周,11B参数,效果还压过14B的VACE。

1. 问题背景与核心挑战:为什么多视角视频转换这么难?

在机器人学习、自动驾驶和具身智能领域,视觉数据是驱动策略学习的关键燃料。然而,真实世界中采集多视角、多模态的演示视频不仅成本高昂,而且难以覆盖多样化的环境和风格。例如,一个机器人操作任务可能需要同时从第三人称固定摄像头、第一人称头戴摄像头以及侧视角摄像头获取数据,这些视角在空间位置、视野范围、光照条件和传感器特性上存在巨大差异。传统的视频生成或编辑方法,如基于单视角的视频扩散模型,往往只能处理单一视角的转换,无法保证多个视角之间在几何结构和外观风格上的高度一致。如果直接将单视角方法分别应用于每个视角,生成的结果会出现严重的“各说各话”现象:物体位置漂移、形状不一致、颜色和纹理风格迥异,完全无法用于训练机器人策略。

VideoWeaver的核心目标正是解决这一挑战。它首次将“多视角视频到视频翻译”(Multi-View Video-to-Video Transfer)定义为一个独立且明确的问题:给定一个或多个源视角的视频(例如,来自仿真环境的合成视频),以及目标风格(例如,真实世界的照片级风格),模型需要生成所有目标视角的视频,使得这些视频不仅各自符合目标风格,而且彼此之间保持像素级和语义级的3D一致性。这种一致性要求模型必须理解不同视角之间的几何投影关系,并在生成过程中显式地利用这种关系,而不是仅仅在图像空间进行风格迁移。

与已有的视频编辑工具(如VACE或Cosmos-Transfer)相比,VideoWeaver的独特之处在于其“多视角”和“几何感知”属性。VACE等工具通常处理单视角视频,或者虽然能处理多段视频,但缺乏对视角间几何关系的建模,导致生成的多视角结果在3D空间中是“松散”的。VideoWeaver通过引入4D点云作为中间表示,将不同视角的潜空间特征“钉”在统一的3D世界坐标系中,从而在生成过程中强制施加几何一致性约束。这就像用一组3D骨架将多个2D画面串联起来,无论相机如何运动,画面中的物体都锚定在同一个物理位置上。

2. 方法主线:VideoWeaver如何构建跨视角一致的生成框架?

VideoWeaver的整体架构是一个基于扩散Transformer(DiT)的多模态视频生成模型,其核心设计可以概括为“一个统一潜空间,两个控制信号,三个关键模块”。

统一潜空间与4D点云注入:模型的核心是一个共享的潜空间,所有视角的视频帧在编码后都映射到这个空间中。为了在这个潜空间中实现跨视角对齐,VideoWeaver引入了4D点云(3D空间+时间)作为几何锚点。具体来说,给定多个视角的视频帧,模型首先使用一个预训练的空间基础模型Pi3(Point-Image Interaction)来预测每一帧的深度图,并利用相机参数将这些深度图反投影到3D空间中,形成动态的4D点云序列。这个4D点云不仅包含了场景的几何结构,还通过时间维度捕捉了物体的运动信息。然后,这个4D点云通过一个轻量级的编码器(例如,基于稀疏卷积或PointNet++的变体)被编码为一组几何特征token。这些token通过交叉注意力机制注入到DiT的各个Transformer层中,从而为每个视角的潜空间特征提供“位置锚定”。这样,无论模型在生成哪个视角,它都能通过查询这些几何token来获取当前视角下物体应有的3D位置和形状信息,从根本上避免了视角间的几何漂移。

双控制信号:深度图与草图:除了4D点云,VideoWeaver还接受两种显式的控制信号:深度图和草图(或边缘图)。深度图提供了每帧的密集几何信息,它与4D点云紧密相关,但以2D图像的形式存在,便于与视频特征进行逐像素的融合。草图则提供了高层级的结构轮廓,有助于模型保持物体的形状和边界。这两种控制信号与源视频帧一起,通过一个控制编码器(类似于ControlNet的结构)被处理成条件特征,并注入到DiT的生成过程中。这种设计使得VideoWeaver能够实现“可控制的”风格迁移:用户不仅可以指定目标风格(通过文本或参考图),还可以通过修改深度图或草图来调整生成视频的几何结构或布局。在实验中,作者发现深度图对于保持几何一致性至关重要,而草图则有助于提升边缘清晰度和纹理细节。

异构时间步训练(Heterogeneous Timestep Training):这是VideoWeaver在训练策略上的一个关键创新。标准的视频扩散模型在训练时,所有帧都从同一个噪声水平(时间步τ)开始去噪。而VideoWeaver在多视角训练阶段,会随机选择一部分视角“冻结”在τ=1(即保持完全干净),而只对剩下的视角添加噪声并执行去噪过程。损失函数也只计算在被加噪的视角上。这种做法的巧妙之处在于,它让模型在训练过程中同时学习了两种分布:一是所有视角联合生成的分布(当所有视角都被加噪时),二是给定部分视角、生成新视角的条件分布(当部分视角被冻结时)。在推理时,这种训练策略带来了极大的灵活性。当需要生成超过3个视角时,模型可以先联合生成3个“种子”视角,然后以这些视角为条件,利用条件生成能力逐个生成其余视角。这类似于自回归生成,但发生在视角维度上,有效降低了同时生成大量视角的计算复杂度,并提升了可扩展性。

3. 模块间关系与输入输出流程

让我们梳理一下VideoWeaver的完整数据流。输入包括:1) 多个视角的源视频帧(例如,3个视角的RGB图像序列);2) 对应的相机参数(内参和外参);3) 可选的目标风格条件(如文本描述“真实室内光线”或一张风格参考图);4) 可选的深度图或草图作为额外控制。输出是:与输入视角数量相同、且满足目标风格和几何一致性的新视频帧序列。

流程如下:首先,源视频帧经过一个预训练的编码器(如VAE)映射到潜空间,得到每个视角的潜特征。同时,源视频帧和相机参数被送入Pi3模型,生成4D点云。Pi3是一个前馈模型,能够快速预测动态场景的几何结构。生成的4D点云经过编码得到几何token。接着,源视频帧、深度图/草图(如果有)以及目标风格条件被送入一个条件编码器,生成多模态条件特征。在DiT的每一层中,潜特征通过自注意力机制进行视角内和视角间的信息交换,通过交叉注意力机制与几何token和条件特征进行融合。几何token确保了视角间的空间一致性,条件特征则注入了风格和结构信息。最后,经过多层Transformer处理后的潜特征通过解码器生成新的视频帧。

值得注意的是,VideoWeaver的DiT架构是“视角无关”的。它将所有视角的token拼接在一起作为一个序列进行处理,并在自注意力中让所有视角的token可以相互“看到”。这种全局注意力机制使得模型能够隐式地学习视角间的对应关系,而4D点云注入则提供了显式的几何约束,两者相辅相成。在实验中,作者发现仅靠全局注意力不足以完全消除几何漂移,而加入4D点云后,跨视角一致性指标(Met3R)有了显著提升。

4. 实验设计与关键结果解读

为了验证方法的有效性,作者在三个公开数据集(涵盖机器人操作、室内场景导航等)和一个内部机器人数据集上进行了大量实验。对比的基线包括当前最先进的视频编辑模型VACE(14B参数)和NVIDIA的Cosmos-Transfer-1,以及一些单视角方法的简单拼接。评估指标包括:1) 视频质量指标(如Dover分数,用于评估整体美观度);2) 跨视角一致性指标Met3R(分数越高越好);3) 语义一致性指标(如CLIP相似度)。

关键结果一:跨视角一致性的显著优势。在Met3R指标上,VideoWeaver在所有数据集上都大幅超越了基线方法。例如,在机器人操作数据集上,VideoWeaver的Met3R分数比VACE高出约10个百分点。这表明4D点云注入确实有效地将不同视角的生成结果“锚定”在了同一个3D世界中,极大地减少了物体位置漂移和形状不一致的问题。相比之下,VACE虽然能生成高质量的单视角视频,但在多视角场景下,其生成的不同视角视频在3D空间中是“各自为政”的,Met3R分数较低。

关键结果二:风格迁移质量与效率的平衡。在Dover分数(衡量视频整体美观度)上,VideoWeaver略低于VACE,但差距很小(例如,低0.5分左右)。作者分析,这可能是由于VideoWeaver为了强制几何一致性,在生成过程中对潜空间施加了更强的约束,从而在一定程度上限制了纹理的多样性和细节的丰富度。然而,VideoWeaver的模型参数量为11B,小于VACE的14B,且训练成本更低(8张昇腾910B训一周)。在推理速度上,VideoWeaver生成3视角81帧视频约需10分钟,虽然离实时性较远,但相比基于4D高斯溅射的优化方法(通常需要40分钟到数小时),已经快了一个数量级以上,更适用于实际的数据生产流水线。

关键结果三:消融实验证明了各组件的必要性。作者进行了详细的消融实验:1) 移除4D点云注入,仅使用全局注意力,Met3R分数显著下降,证明了几何锚定的不可替代性;2) 移除异构时间步训练,模型在生成超过3个视角时性能下降明显,且推理速度变慢,证明了该策略对可扩展性的贡献;3) 移除深度图控制,几何一致性略有下降,但影响小于移除4D点云,说明深度图是辅助性的几何信息,而4D点云是核心。这些消融实验清晰地揭示了每个设计选择的作用。

5. 适用边界与局限性分析

尽管VideoWeaver取得了令人瞩目的成果,但它并非万能。首先,它的性能高度依赖于Pi3模型预测的4D点云质量。Pi3是一个前馈模型,虽然在多数场景下表现良好,但在处理严重遮挡、透明物体(如玻璃杯)、高反光表面或极端光照条件时,其深度预测可能不准确,导致点云出现噪声或空洞。这些错误的几何信息会直接传递给生成模型,造成跨视角一致性的退化。作者在论文中也提到,对点云噪声的鲁棒性分析是未来工作之一。

其次,模型的推理速度(10分钟生成3视角81帧)和硬件需求(需要高性能GPU集群)限制了其在实时或低资源场景下的应用。虽然比4D高斯溅射方法快,但对于需要大规模、快速迭代数据生成的场景,这仍然是一个瓶颈。

第三,异构时间步训练虽然带来了视角数的可扩展性,但作者仅实测了最多8个视角的情况。当视角数量进一步增加时,自回归生成策略可能会累积误差,导致后续生成的视角与初始视角的一致性下降。此外,模型对相机参数的质量敏感,如果相机标定不准确,4D点云的构建也会出错。

最后,视频细节方面,由于强几何约束,生成结果在纹理丰富度上略逊于专门优化单视角美观度的模型(如VACE)。对于需要极致视觉逼真度的应用(如电影特效),这可能是一个短板,但对于机器人数据增强这一核心目标,几何一致性远比细微的纹理更重要。

6. 与现有工作的对比及创新点总结

与VACE、Cosmos-Transfer等通用视频编辑模型相比,VideoWeaver的创新性体现在三个层面:问题定义层面,首次明确提出了多视角V2V翻译问题,并建立了相应的评估体系(引入Met3R指标);方法论层面,创新性地将4D点云作为跨视角几何锚点注入到扩散Transformer中,实现了显式的3D一致性约束;训练策略层面,提出了异构时间步训练,使得模型能够灵活地处理可变数量的视角,并支持自回归式的视角扩展。这些创新点共同构成了一个完整且实用的解决方案,为多视角视频生成领域开辟了新的研究方向。

当然,单视角部分的MoE融合和自回归生成思路在NLP或图像生成领域已有类似探索,但将其成功应用于多视角视频生成并解决几何一致性问题,是VideoWeaver的独特贡献。它证明了将3D几何先验与2D扩散模型相结合,是解决多视角生成问题的有效途径。

7. 对机器人学习与具身智能的潜在影响

VideoWeaver最直接的应用场景是机器人学习中的数据增强。在模仿学习和强化学习中,策略模型需要海量的、多样化的视觉数据。通过VideoWeaver,研究人员可以将仿真环境中的低成本合成视频(例如,来自MuJoCo或Isaac Gym的渲染)转换为逼真的真实世界风格视频,同时保持多视角的几何一致性。这意味着,一个在仿真中训练的视觉策略,可以通过VideoWeaver生成的“伪真实”数据进行微调,从而显著提升其在真实世界中的泛化能力,而无需昂贵的真实数据采集。此外,它还可以用于跨机器人平台的数据迁移(例如,将UR5e机械臂的数据转换为Franka机械臂的视角),或者用于生成不同天气、光照条件下的自动驾驶场景视频,增强感知模型的鲁棒性。

“推理时可丢模态”的特性(即可以灵活选择输入的控制信号)和“自回归扩展视角数”的能力,使得VideoWeaver非常易于集成到现有的数据处理pipeline中。工程团队可以根据实际需求,选择性地输入深度图或草图,并逐步生成所需数量的视角,这为大规模自动化数据生产提供了可能。

8. 异构时间步训练(Heterogeneous Timestep Training)具体是怎么操作的?

正常训练时,所有视角都从τ=0的纯噪声开始,一起向τ=1的真实视频去噪。异构时间步训练则是在多视角训练阶段,随机选一部分视角"冻结"在τ=1(即保持干净),只有剩下那些视角被加噪到某个τ值并参与去噪,损失也只计算在被加噪的视角上。这样模型就见过两种训练信号:所有视角一起生成(联合分布),以及给定已有视角、生成新视角(条件分布)。推理时当相机数超过3个,可以先联合生成3个,再以其中部分视角为条件,逐个生成其余视角。

9. Met3R这个指标是干嘛的?

Met3R是一个衡量多视角一致性的指标,由一套论文提出,基于DUST3R和DI-NOv2两个视觉模型的特征来评估不同视角生成结果之间的几何和外观一致性。做法是把两个视角的特征用DUST3R对齐后在特征空间里算相似度,分数越高说明两个视角"越像同一个3D世界"。它解决了以前没有合适指标来量化"跨视角一致性"的问题。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
这篇工作的边界或风险在哪里?优点:首次提出多视角V2V框架,通过4D点云统一潜空间实现跨视角一致性,支持自回归生成新视角,MoE模块有效融合多模态控制信号。缺点:对小物体仍存在不一致性,帧数固定无法生成长序列,训练计算资源需求大。
这篇工作最值得看的点是什么?在多数指标上优于现有方法,特别是在对齐精度和视觉保真度方面;多视角变体在Droid和Agibot上优于单视角模型。
这篇论文到底在解决什么问题?华为海森堡研究中心联合慕尼黑大学、弗莱堡大学提出VideoWeaver,首个多模态多视角视频转换框架。
下面是龙哥对于大家可能的一些问题的解答:

龙迷三问


龙哥点评

论文创新性分数:★★★★☆

提出VideoWeaver,首个多模态多视角视频到视频转换框架,通过将Pi3估计的4D点云坐标注入光流模型的潜空间,统一多视角的潜在表示,实现跨视角一致的风格转换。

实验合理度:★★★★☆

VBench, Dover, Edge-F1, Depth-siRMSE, JEDi, Met3R

学术研究价值:★★★★☆

提出VideoWeaver,首个多模态多视角视频到视频转换框架,通过将Pi3估计的4D点云坐标注入光流模型的潜空间,统一多视角的潜在表示,实现跨视角一致的风格转换;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在8张Ascend 910B卡(64GB)上训练约一周;推理时生成3个视角81帧的视频约需10分钟。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:对小物体仍存在不一致性,帧数固定无法生成长序列,训练计算资源需求大。

主要参考文献

[1] Eskandar G, Shen F, Altillawi M, et al. VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents. arXiv:2603.25420, 2026.
[2] Chen H, et al. Pi3: Feed-forward spatial foundation model for 4D reconstruction. 2024.
[3] Yang Z, et al. VACE: All-in-one video creation and editing. 2024.
[4] NVIDIA. Cosmos-Transfer-1: World foundation model for physical AI. 2025.
[5] Hu A, et al. Met3R: Measuring multi-view consistency. 2025.
[6] Liu Y, et al. Pi3: Point-image interaction for 3D perception and generation. 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
机器人学数据贵到肉疼?多视角视频风格迁移了解一下!扫描下方二维码或添加龙哥助手微信号加群:kangjinlonghelper。备注格式:研究方向+地点+学校/公司+昵称,如"多模态+上海+清华+小龙",格式正确可更快被通过进群哦~ 图像处理、大模型、自动驾驶及机器人、AI医疗、AI金融五大群已就位,机器人数据增强的坑,咱们群里一起踩!
wechat_helper dianzan

原论文信息如下:
论文标题:
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
发表日期:
未找到日期
发表单位:
Huawei Heisenberg Research Center, Ludwig Maximilian University of Munich, University of Freiburg, Munich Center for Machine Learning (MCML)
原文链接:
https://arxiv.org/abs/2603.25420

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。