← 返回 PaperDaily 视觉与图像

图像生成|东京大学最新研究:全景图生成提速15倍,质量反而更高?

生成一张360度全景图要等半小时?东京大学团队把时间压缩到2分钟,画质还更好,凭什么?

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Linear Fusion MultiDifusion for Fast Training-Free Spherical Panorama Generation
发表日期:
2026年
发表单位:
东京大学、RIKEN先进智能项目中心
原文链接:
https://arxiv.org/pdf/2609.01997v1.pdf
开源代码链接:
论文暂未提供
项目链接:
https://ahykw.github.io/lfmd

想象一下这样的场景:你戴着头戴式显示器(HMD)站在虚拟样板间里,想向左看、向右看、抬头看天花板、低头看地板,四周的场景无缝衔接,毫无违和感。这种沉浸式体验的背后,是一张360度全景图(Panorama)在支撑。

全景图的应用早已不局限于VR游戏。房地产的虚拟看房、街景地图的漫游、影视特效的全景背景,甚至元宇宙里的虚拟空间,都依赖高质量的全景内容。然而,怎么高效地生成一张看起来自然、 geometrically 一致的全景图,至今仍是个让人头疼的问题。

过去几年,主流思路大致分成两派。一派是训练专用模型,用大量"文本-全景图"配对数据微调扩散模型。这种方法效果不错,但成也数据、败也数据——全景图配对数据极其稀缺,导致模型只能覆盖特定领域。比如你用室内全景数据训练的模型,想让它生成一张"赛博朋克风格的外星街道",它大概率会翻车。

另一派更有野心:干脆不训练,直接拿现成的文生图模型(比如FLUX、Stable Diffusion)来拼全景图。这就好比请一位顶尖的平面画家,不经过任何全景培训,直接让他画一张360度环幕作品。画家本身功力深厚,但环幕的几何结构是个大坑,怎么让画面在首尾相接处无缝、在南北极不扭曲,全靠调度技巧。

这一派里,DynamicScaler和SphereDif是代表。两者的思路很像:从全景图的潜变量出发,用多个不同朝向的透视相机"看"全景的不同局部,再把这些局部交给预训练的文生图模型去噪,最后把去噪结果拼回全景空间。为了让每个像素都被覆盖到、同时保证接缝自然,它们需要极其密集地采样视角——DynamicScaler要用44个透视视角,而SphereDif更夸张,要用89个视角!

代价是什么?每多一个视角,就要完整跑一次扩散模型的去噪。用FLUX作为基座模型时,DynamicScaler生成一张全景图需要大约7分半钟,SphereDif则要32分钟。哪怕只是简单改一句提示词,也得熬过半个小时的漫长等待。这还谈什么创作效率?🤚

问题的根源在于MultiDifusion框架的一个隐含假设:全景空间与透视视图之间只能做"直接像素采样"(一对一映射)。这种刚性限制导致很多全景像素在重投影时根本找不到对应的透视像素,不得不靠堆叠大量重叠视角来强行覆盖。能不能打破这个假设,让映射变得更"柔软"?

东京大学的研究团队给出了一个漂亮的答案。他们提出LF-MultiDifusion,把MultiDifusion从"直接像素采样"推广到"任意线性投影",把潜变量聚合重新建模成一个带正则化的最小二乘问题,再借助Krylov子空间迭代求解器在去噪循环内高效求解。最终结果相当惊人:仅需14个视角,生成质量和一致性全面超越SphereDif,推理速度提升15.36倍,从32分钟压缩到2分钟出头。

LF-MultiDifusion效果对比图

图1:LF-MultiDifusion在训练无关设定下,用预训练文生图模型实现高质量全景图生成,达到SOTA效果且运行时间更快。

这篇论文的作者来自东京大学与RIKEN先进智能项目中心(AIP),包括Akio Hayakawa、Yusuke Mukuta和Tatsuya Harada。论文目前已在arXiv上公开,项目主页也同步上线。下面咱们就一起来拆解,LF-MultiDifusion究竟做了什么,又是怎么做到"更快还更好"的。

为了让大家先直观感受一下效果,可以先看看下面这段论文展示视频,感受一下不同视角切换时的连续性和画面质量:

您的浏览器不支持视频标签,可前往项目主页 https://ahykw.github.io/lfmd 查看演示视频。

视频1:LF-MultiDifusion生成的全景图多视角漫游演示(视频来自论文项目主页)。

相信看完视频,你已经对效果有了初步印象。接下来,本文将从技术根源出发,讲讲全景图生成到底难在哪,MultiDifusion为什么慢,以及LF-MultiDifusion如何用"线性投影+迭代求解"的组合拳破局。

全景图生成的真正难点

先聊点背景。扩散模型和流匹配模型已经成为文生图的主流骨干,但这类模型通常在固定的宽高比和分辨率下训练。比如FLUX原生生成1024×1024的方形图,你让它直接生成2048×4096的全景图,画面布局很快就会崩坏。这不是模型能力不够,而是训练分布之外的外推本身就不可靠。

MultiDifusion提供了一种模型无关的零样本方案:把大幅画布拆成多个局部块,每个局部块用预训练模型独立去噪,再在重叠区域融合。这样既绕开了分辨率外推问题,又不需任何训练。DynamicScaler和SphereDif正是沿着这个思路,把"画布"换成ERP全景图,"局部块"换成透视视角。

听起来很顺理成章,但坑藏在细节里。MultiDifusion的融合公式基于一个关键假设:目标空间(全景图)到参考空间(透视视图)的映射F是一个"直接像素采样"算子——也就是每个目标像素都能唯一取到某个参考像素的值。这种一对一映射在平面大画布上没有问题,但在360度全景的ERP表示下立刻露馅:当一个透视视图被投影到ERP全景图上时,由于ERP坐标是非线性的,透视视图中很多像素对应的全景位置并不是整数网格点。反过来,如果要用直接采样把去噪后的透视像素放回全景,就会留下一大片"空洞"像素,根本没有数据来源。

图3直观展示了这个问题。单个透视视角在ERP全景上覆盖的像素区域(白色部分)内,有大量像素处于未覆盖状态(白色区域中间的黑点)。即便对同一视角在不同纬度上做投影(纬度77.5度、0度、负45度),未覆盖像素依然大量存在。

ERP直接采样覆盖问题

图2:透视视角到全景图的直接像素采样映射。(a) 单个视角在ERP全景上覆盖的像素(白色),存在大量未覆盖像素;(b) SphereDif用89个相机位置密集覆盖全景,但代价是每个视角都要跑一次扩散模型。

对此,DynamicScaler和SphereDif的解决办法简单粗暴:多放视角,让视角之间大面积重叠,用密集覆盖强行消除空洞。DynamicScaler用44个视角,SphereDif用89个视角。这直接导致扩散模型调用次数剧增——每个视角在每一步去噪都要被完整推理一次。用FLUX跑一次全景图,DynamicScaler耗时约7.5分钟,SphereDif耗时约32分钟。

如果能让映射变得更"聪明"一点呢?比如用双线性插值代替直接采样?图4a显示,双线性映射下,一个透视视角就能无空洞地覆盖全景中心区域。那直接把MultiDifusion的融合公式从直接采样换成双线性插值行不行?论文给出了一个反直觉的结论:不行!图4b显示,这种朴素扩展会在去噪中途把潜变量搞得一团糟,生成的图像模糊成一团。原因在于,直接像素采样下融合公式有闭式解——去噪后的各视角结果按权重加权平均即可;而换成双线性映射后,这个封闭解不再成立,盲目延用加权平均会违背与预训练模型的一致性约束。

不同映射策略生成效果对比

图3:在全景图与透视视图之间使用双线性映射生成全景图。(a) 双线性映射无像素空洞;(b) 朴素扩展融合公式产生模糊结果;(c) LF-MultiDifusion在相同映射下生成高质量图像。

LF-MultiDifusion:把问题变成一个优化问题

LF-MultiDifusion的核心思想,是把MultiDifusion的融合公式从"直接像素采样"扩展到"任意线性映射"。给定一个目标全景图J,第i个透视视角的图像可以写成S_{t,i}J——这里S_{t,i}是一个线性投影矩阵,把全景潜变量投影到某个透视视角的潜变量。这个投影用双线性插值实现,因此能保证全景每个像素都被覆盖,没有空洞。

此时,MultiDifusion的目标不再是简单地把各视角去噪结果加权平均,而是要找一个全景图J_{t-1},使得它投影到每个透视视角后,都尽可能接近预训练模型对各视角去噪后的结果。这天然地变成一个最小二乘问题:最小化所有视角的投影误差之和。论文进一步加入一个正则化项(可选择脊正则或拉普拉斯正则),把问题改写成带正则化的最小二乘形式。

直接求解这个最小二乘问题需要构造并求逆一个巨大的正规方程矩阵,对于2048×4096的高分辨率全景图来说计算量完全不可接受。论文的聪明之处在于引入Krylov子空间迭代求解器(PCG或LSMR),以"矩阵自由"的方式求解——整个迭代过程只需要计算S、S的转置以及正则化算子对向量的作用,根本不用显式构造投影矩阵。这样既绕开了显式求逆的灾难性开销,又能精确逼近最小二乘解。

LSMR迭代收敛速度图

图4:LSMR求解器更新与单步MultiDifusion去噪总成本的运行时间对比。在去噪时间步t=7、14、21处,每10次求解器更新记录一次归一化残差。LSMR仅需数十次迭代即快速收敛,求解器开销不足去噪成本的20%(灰色虚线)。

实验显示,这个Krylov求解器的收敛速度快得惊人:仅仅数十次迭代就能让残差降到很低的水平,而求解器更新所花的时间不足单步MultiDifusion去噪成本(14个视角全部跑一次FLUX)的20%。相比DynamicScaler的44个视角和SphereDif的89个视角,N=14的视角数意味着去噪总成本直接降到原来的约三分之一到六分之一——这里的提升远超求解器本身的开销。

从算法层面看,LF-MultiDifusion的整体流程分为两个阶段。第一阶段是全景潜变量优化:在去噪的前段(从第28步到第23步),每一步先对每个视角渲染当前全景潜变量,用预训练模型去噪,再用LSMR求解最小二乘问题得到更新后的全景潜变量,如此迭代循环。第二阶段是视角级后精修:在第23步停止全景优化后,把当前全景潜变量渲染成一组透视视角潜变量,然后每个视角用预训练模型独立继续去噪至最后一步,最后用SphereDif提出的畸变感知加权平均把这些精修后的视角图拼回ERP全景图。第二阶段的意义在于,把每个局部视角重新拉回预训练模型的"主场"进行生成,恢复高频细节,同时保留第一阶段建立的全景一致性。

实验效果:又快又好的秘密

论文的实验做得比较扎实。基座模型用的是FLUX,文本提示沿用SphereDif的20组提示,每组提示生成10张全景图,输出分辨率为2048×4096,透视视角为512×512。对比的基线包括两个训练无关方法DynamicScaler和SphereDif,以及两个训练类方法Text2Light和PanFusion,全部使用FLUX作为基座模型以确保公平。

评估指标也很全面:用MUSIQ评估成像质量,用LAION美学预测器评估美感,用CLIP相似度衡量文图对齐,用Q-Align做额外的感知质量评估,另外还引入基于Qwen-VL的视觉语言模型评估畸变和连续性。

定量对比结果表

图5:与基线方法的定量对比。测试分辨率2048×4096(PanFusion仅支持512×1024)。所有指标越高越好,Runtime越低越好。LF-MultiDifusion在全部指标上超越最强训练无关基线,同时实现15.36倍加速。

先看最硬核的数字:推理时间。SphereDif需要32分15秒,DynamicScaler需要7分31秒,而LF-MultiDifusion只用2分6秒。相比SphereDif,提速15.36倍;相比DynamicScaler,提速3.58倍。更难得的是,这是"又快又好":美学分数从SphereDif的0.533提升到0.568,成像质量从0.597提升到0.616,Q-Align从3.23提升到3.34,CLIP相似度从27.65提升到29.19,畸变和连续性评分也分别从4.64/4.82提升到4.64/4.86。换句话说,视角数减到六分之一,时间减到十五分之一,质量反而全面反超。

这背后的逻辑其实很清晰:SphereDif要用89个视角是因为直接采样覆盖不了全景,必须靠视角堆叠来填洞;LF-MultiDifusion用双线性投影天然无空洞,14个视角就足以覆盖全图。更重要的是,少而精的视角让优化问题更良态,避免了过多重叠带来的冗余融合。论文作者在消融实验中也证实:当视角数从14增加到20、26时,部分指标反而下降。这进一步说明,Linear Fusion的思路不只是"省算力",而是从根本上缓解了过拟合式的重叠采样问题。

更多实验细节:消融与人因评测

光看一张总表还不够,论文还做了几组消融实验,帮我们理解方法里每个旋钮的作用。

第一组消融是求解器类型和迭代次数。LSMR在10次迭代时Q-Align就已达到3.27,30次迭代进一步提升到3.34;PCG在同样设置下只有3.04左右。说明LSMR作为专门求解最小二乘的迭代算法,确实比PCG更适合这个任务。迭代次数从10增加到30有明显收益,但到100次时收益趋近于零,说明30次是性价比最优的选择。

生成效果主观对比图

图6:主观效果对比。DynamicScaler在极点附近(±90度)常出现畸变,SphereDif和LF-MultiDifusion都能生成各方向自然的视图,而LF-MultiDifusion的整体保真度更高。

第二组消融是正则化项及其系数。论文测试了脊正则和离散拉普拉斯正则两种选择,结果表明两者性能接近,拉普拉斯正则配合λ=10^{-4}时取得最好的Q-Align(3.341)和CLIP分数(29.19)。值得注意的是,完全不使用正则化(λ=0)时性能明显下降,说明正则化项在稳定迭代求解上确实起了实打实的作用。

第三组消融是视角数量N的敏感度。N=6时虽然美学和成像分数很高,但畸变和连续性评分大幅下滑(从4.64跌到3.98),说明视角太少无法保证全局的无缝一致;N=14是质量和一致性的最佳平衡点;N继续增大到20或26,部分指标反而下降,这印证了论文的核心判断——依赖大量重叠视角的旧范式并非最优选择。

论文还做了一项用户研究,11位参与者对三种方法在图像质量、畸变程度、连续性三个维度打分(5分制)。LF-MultiDifusion在图像质量上拿到4.07分,明显高于SphereDif的3.64分;连续性和畸变维度也分别以4.07和3.75领先。这从人的主观感知层面再次确认了定量指标的趋势。

不止于全景图

论文的价值可能还不止于全景图本身。把MultiDifusion的映射从直接采样推广到任意线性算子,这个抽象层级的提升,让类似的"区域级生成"思路可以迁移到更广泛的非平面域,比如球面、环面乃至任意网格曲面上的纹理合成。附录中作者就把这套方法扩展到了文本到全景视频生成,用LTX-Video把生成时间从25分14秒压缩到2分44秒,相关指标同样全面领先。这某种程度上已经预告了这类方法在3D内容生产管线中的想象空间。

值得肯定的地方与值得商榷的地方

先讲值得肯定的地方。把受限的直接采样松弛为线性投影并配一个高效的迭代求解器,这个建模视角相当干净。它没有引入任何新训练,没有改动基座模型的参数,纯粹靠优化策略的重构拿下了数量级的推理加速,同时质量还涨了。这在当下的生成式AI研究里是一股清流——毕竟很多工作靠堆算力和堆参数来刷指标,而这种"用数学换算力"的思路反而显得稀缺。

在应用层面,这套方法的落地价值也比较直接。全景内容创作目前受限于高昂的生成成本,而LF-MultiDifusion让单张全景图的生成进入分钟级,这意味着一台普通A100就能支撑起小规模的内容生产流水线。对VR看房、虚拟旅游、游戏场景预演等需要批量产出全景素材的行业来说,成本下降一个数量级可能就意味着从"不可用"到"可用"的跨越。

再讲值得商榷或值得追问的地方。一方面,双线性插值虽然消除了ERP映射的像素空洞,但当视角倾斜角很大时,ERP高纬度区域的采样密度仍然不均匀,畸变感知加权平均也只能部分缓解这一问题。论文在低纬度区域展示的效果很好,但两极区域的细节表现力还有待更多可视化结果支撑。另一方面,第二阶段(视角级后精修)本质上是在全景优化结束后又跑了一轮独立视角的去噪,这段开销占了总时间的相当比例。论文没有给出单独移除这一阶段的对照实验,如果未来能把精修阶段压缩甚至合并进统一框架,可能还有进一步的提速空间。

此外,项目页面显示代码尚未完全开源,这对复现和工程落地稍有不利。从当前文章描述看,方法本身不依赖特定基座模型,理论上可以套用任何文生图模型,这是一个面向未来的好属性。

给读者的建议

如果你是做扩散模型应用、VR/AR内容生产、或者对"训练无关生成"感兴趣的研究者,这篇论文值得精读。它提供了一个优雅的思路范本:当现有融合框架的限制成为性能瓶颈时,从数学上重新审视映射假设,往往比堆叠更多资源更有效。如果你正在做全景图生成相关的产品,那么这篇论文的工程参考价值也很高——2分钟生成一张2048×4096的高质量全景图,已经迈过了很多实时性要求不高的产品门槛。

当然,也要提醒一句:这本质上仍是"单张全景图生成"的方法,离真正的可交互3D场景自由漫游还有一段距离。想直接体验到"走进全景图"的感觉,还需要与3D高斯泼溅等场景表达相结合。期待作者团队后续在更多曲面拓扑(比如环形场景、可直接漫游的走道式空间)上的延伸。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
这篇工作的边界或风险在哪里?优点:(1) 将MultiDifusion从直接像素采样推广到任意线性投影,理论框架更通用;(2) 通过正则化最小二乘和Krylov迭代求解器实现高效优化,大幅减少视角数量和推理时间;(3) 免训练设计继承了基础模型的提示覆盖范围,支持任意宽高比和分辨率;(4) 两阶段流程(全景优化+视角细化)兼顾全局一致性和局部细节。缺点:(1) 依赖Krylov迭代求解器的收敛性,迭代次数需经验调优;(2) 后细化阶段仍需逐视角去噪,存在一定计算开销;(3) 与训练方法相比,在特定领域(如室内场景)的生成质量可能不如专门训练的模型;(4) 对视角数量和分布较敏感,需要仔细设计。
这篇工作最值得看的点是什么?在所有指标上超越最强免训练基线SphereDif(Aesthetic 0.616 vs 0.597,Imaging 0.568 vs 0.533,QAlign 3.34 vs 3.23,CLIP 29.19 vs 27.65,Distortion 4.64 vs 4.64,Continuity 4.86 vs 4.82),同时实现15.36倍加速;用户研究在图像质量、畸变和连续性三方面均获最高分。
这篇论文到底在解决什么问题?针对训练无关全景图生成推理慢、视角数需求大的痛点,东京大学提出LF-MultiDifusion,将MultiDifusion扩展到任意线性投影,借助Krylov迭代求解器在去噪循环内高效优化潜变量,仅用14个视角即可生成2048×
下面是龙哥对于大家可能的一些问题的解答:

龙迷三问


龙哥点评

论文创新性分数:★★★★☆

提出LF-MultiDifusion,将MultiDifusion扩展至支持任意线性投影,通过将潜变量聚合重构成正则化最小二乘问题,并使用Krylov迭代求解器在去噪循环内高效求解,从而减少视角数量并加速全景图生成。

实验合理度:★★★★☆

Aesthetic(LAION美学预测器)、Imaging(MUSIQ)、QAlign、CLIP相似度、Distortion和Continuity(基于Qwen-VL的VLM评估)、用户研究(5点Likert量表)、运行时间

学术研究价值:★★★★☆

提出LF-MultiDifusion,将MultiDifusion扩展至支持任意线性投影,通过将潜变量聚合重构成正则化最小二乘问题,并使用Krylov迭代求解器在去噪循环内高效求解,从而减少视角数量并。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

生成2048×4096全景图耗时2分06秒(单张NVIDIA A100 40GB GPU),相比SphereDif加速15.36倍,相比DynamicScaler加速3.58倍;Krylov迭代求解器开销仅占单步去噪成本的约20%。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:现有材料尚未充分覆盖分布外泛化、部署成本、长期稳定性和失败案例。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球