← 返回 PaperDaily 视觉与图像

两张模糊图就能重建3D?PSNR暴涨2.11dB新方法出炉

当只有两张随手拍的模糊照片、还没有相机位姿时,3D重建还能做吗?本论文不仅做了,还用级联的2D→3D引导把Deblur-NeRF真实场景PSNR提升了1.19dB、合成场景提升了2.11dB。这种极简输入设定对XR、手持设备3D内容生成非常有吸引力。

两张模糊图就能重建3D?PSNR暴涨2.11dB新方法出炉
原论文信息如下:
论文标题:
CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images

发表日期: 2026年8月

发表单位: 美国弗吉尼亚大学、韩国KT研发中心

原文链接: https://arxiv.org/pdf/2608.10345v1.pdf

项目链接: https://haeyun-choi.github.io/Cascaded2D3D_page/

从两张模糊图到3D世界:CasDeblurGS如何突破极限?

想象一下:在光线不好的博物馆里随手拍两张照片,手一抖全糊了。这时若有人说“给我这两张烂图,我能变出一个可自由切换视角的3D场景”,你是不是觉得他在吹牛?
这还真不是天方夜谭。来自弗吉尼亚大学和韩国KT研发中心的研究者,最近放出了一篇题为CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images的论文,专门解决这个“地狱级难度”的问题。
图1:CasDeblurGS方法示意图
图1:左侧显示仅给定两张模糊图像,CasDeblurGS渐进式地结合局部2D引导与全局3D引导,实现连贯的3D高斯重建;右侧对比CoherentGS、Difix3D+和GAURA,本文方法在极具挑战的两视图模糊设定下生成了更清晰的细节和更连贯的新视角。
传统3D重建方法,如基于神经辐射场(NeRF)或3D高斯泼溅(3DGS)的方案,通常需要几十张图像,还得用运动恢复结构(SfM)算出精确的相机位姿。一旦输入变成两张、还带着运动模糊,传统管线基本上当场宕机——特征点匹配全乱套,位姿估计直接发散。
CasDeblurGS的牛逼之处在于,它把整个问题重新定义了一遍:输入只需要两张模糊图和相机内参,输出直接就是一个pose-free(无位姿)的3D高斯表示。不需要辅助清晰图,不需要位姿,也不需要逐场景测试时优化。这种极简设定,对XR、手持设备3D内容生成这些实际应用来说,简直是量身定做的。
要理解这个问题的难度,不妨拆解一下。首先,两张图像之间的视角差异通常较大,这意味着场景中大量区域在两张图中并不可见,存在严重的遮挡和视差问题。其次,运动模糊不仅抹去了高频纹理细节,还破坏了图像间的几何对应关系——模糊的像素是相机运动期间多条光线的积分结果,其“真实位置”本身就是一个模糊的概念。最后,没有相机位姿意味着我们无法利用多视图几何中的三角化、极线约束等经典工具来约束重建过程。这三个难点叠加在一起,使得两视图模糊重建成为一个极具挑战性的问题。
CasDeblurGS的核心洞察在于:与其试图一次性解决所有问题,不如将问题分解为一系列渐进的子任务。每个子任务都建立在前一个子任务的基础上,逐步恢复跨视图的一致性信息。这种“由粗到细、由局部到全局”的策略,在计算机视觉的许多领域都已被证明是有效的,但将其应用于两视图模糊重建,本文是首次。

级联2D到3D:渐进式多视图一致性恢复策略

核心难点先理清楚:两张模糊图之间,既能用于2D匹配的高频细节被抹掉了,能用于3D聚合的几何一致性也基本被破坏。如果在2D层面直接找对应关系,光流估计很容易被模糊带偏;如果硬要把不一致的观测凑到3D空间里,误差会滚雪球一样传播进最终场景。
本论文的破局思路很清晰:渐进式地恢复跨视图信息,从局部2D对应关系出发,逐步过渡到全局3D引导。整个pipeline分两个阶段,就像先让两个人互相确认“你那边看到的东西是什么样的”,再把他们各自的理解放进一个共享的三维空间里互相校准。
图2:CasDeblurGS方法总览
图2:CasDeblurGS整体框架图。上半部分显示级联流程:先构建局部2D引导,再用冻结的pose-free 3DGS骨干网络提供全局3D引导以完成最终复原;最终的复原图再次送入同一骨干网络进行新视角合成。下半部分展示了OCGM的细节:稳定输入、估计双向RAFT光流、推导前向-后向一致性掩码,并生成掩码化的跨视图warp结果供Stage 1使用。
Stage 1做的是“局部2D引导与去模糊”。具体来说,先用一个冻结的稳定器(Stabilizer)对输入的模糊图做预处理。这里的稳定器用的是预训练的NAFNet,它并不直接输出最终的去模糊结果,而是生成对对齐更友好的观测图。为什么要多此一举?因为直接在两张严重模糊的图上估计光流,结果就像在雾里看人,根本分不清谁是谁。先把雾拨开一点,再去找对应关系,成功率会高很多。
Stage 1的输出是两张中间复原图(\~S₁,\~S₂)。这两张图比原始模糊输入清晰不少,而且跨视图一致性已经有所改善,但这远远不够。真正让方法产生质变的,是Stage 2的全局3D引导。
从信息流的角度来看,Stage 1的2D引导本质上是一种“局部证据传递”机制。它通过光流将参考视图中的可信像素信息传递到基础视图中,填补基础视图中因模糊或遮挡而缺失的细节。然而,这种传递是逐像素的、局部的,它无法捕捉场景中远处的、非局部的一致性关系。例如,一个被前景物体遮挡的背景区域,在两张图中可能都不可见,但通过3D场景结构的推断,我们可以合理地猜测其外观。这正是Stage 2的3D引导所要补充的。

OCGM模块:遮挡感知的跨视图对应关系过滤

这里有一个关键的技术细节值得单独拎出来讲:OCGM(Occlusion-aware Cross-view Guidance Module,遮挡感知的跨视图引导模块)。这玩意儿解决的是光流估计中最让人头疼的遮挡和误匹配问题。
简单来说,OCGM干了两件事。第一,在稳定后的图上用冻结的RAFT-Large模型估计双向光流(即从图1到图2,以及从图2到图1);第二,用前向-后向一致性检查来过滤不可靠的匹配,并加了一个运动自适应的阈值。
这里的逻辑很直白:如果一个像素点在图1中位于某个位置,通过光流映射到图2中的对应位置,再从图2映射回来,如果回不到原来的位置,说明这个对应关系不可靠。公式化地说,对于基础视图中的像素位置x,映射到参考视图的坐标是x′ = x + F_br(x),前向-后向残差为e(x) = ‖F_br(x) + F_rb(x′)‖₂。运动自适应阈值T(x) = τ + α(‖F_br(x)‖₂ + ‖F_rb(x′)‖₂)允许大位移情况下有一定的容差,避免过度过滤有效对应。
最终的有效性掩码M_br(x)要求同时满足两个条件:一是映射坐标不越界,二是前向-后向残差小于阈值。只有通过这些检查的对应关系才会被保留,然后构造掩码化的跨视图warp结果W_br = M_br ⊙ W(C_r, F_br)作为Stage 1去模糊网络的额外输入通道。
图:跨视图对应可视化
跨视图2D匹配可视化:绿色线段表示输入视图间的跨视图2D匹配。可以看到,随着级联流程的推进(中图,SSIM 0.703,112个匹配),相比基础稳定器输出(左图,SSIM 0.691,96个匹配)和仅使用Stage 1的结果(右图,SSIM 0.666,77个匹配),匹配数量和质量都显著提升。
为什么需要运动自适应阈值?这是论文中一个非常细腻的设计。在光流估计中,大位移区域的残差天然会比小位移区域更大,因为光流估计的误差通常与位移量成正比。如果使用一个固定的阈值,那么在大位移区域,即使正确的匹配也可能因为残差较大而被误过滤;而在小位移区域,错误的匹配可能因为残差较小而漏网。运动自适应阈值通过将阈值与光流幅度线性相关,使得过滤标准在不同运动幅度下保持一致的严格程度。实验表明,这一设计相比固定阈值能够保留更多有效匹配,同时过滤掉更多错误匹配。
此外,OCGM的另一个细节是,它只在Stage 1中使用,而Stage 2的3D引导则通过冻结的3DGS骨干网络隐式地处理遮挡问题。这是因为3DGS的显式几何表示天然能够处理遮挡——在渲染时,只有可见的高斯会被投影到图像平面上,被遮挡的高斯则不会贡献颜色。因此,3D引导提供的重渲染图像R₁和R₂中,遮挡区域的信息是“合理推测”的结果,而非简单的像素复制。

全局3D引导:无位姿重建的关键一步

Stage 2的设计是整个方法的灵魂所在。它先把Stage 1得到的两张中间复原图和对应的相机内参一起送入一个冻结的pose-free 3DGS骨干网络(用的是NoPoSplat,在RealEstate10K上预训练),构建一个临时3D表示G。然后,把这个临时表示在输入视角处重新渲染,得到两张重渲染图R₁和R₂。
公式:临时3D表示构建
中间复原图被送入冻结的pose-free 3DGS骨干网络h_η,构建临时3D高斯表示G。
公式:重渲染引导生成
将临时3D表示G在输入视角v₁和v₂处重渲染,得到密集的全局引导图像R₁和R₂。
这两张重渲染图就是“全局3D引导”的具体形式。为什么它们如此重要?因为G是同时从两张中间复原图中聚合信息构建的,重渲染回来的图像就自然编码了跨视图的全局场景信息。这相当于让两个视角的信息在一个共享的三维空间里先融合一遍,再把融合结果投影回图像平面,为最终的复原提供稠密的全平面引导。
最后一步,把原始模糊图和重渲染图拼接在一起,送进3D引导的去模糊网络D_ψ^3D,得到最终复原图(Ŝ₁,Ŝ₂)。这两张最终复原图再次送入同一个冻结的pose-free 3DGS骨干网络,构建输出的3D表示G*,用于后续的新视角合成。
这个级联设计的巧妙之处在于:Stage 1的局部warping选择性传递可信的细粒度跨视图证据,Stage 2的临时3D表示则聚合了两个视图的信息来提供密集的场景级反馈。两者互补,既保留了细节,又保证了全局一致性。
从数学角度看,Stage 2的3D引导可以理解为一种“隐式的多视图一致性约束”。在训练过程中,D_ψ^3D被要求输出的复原图Ŝ₁和Ŝ₂,不仅要与各自的模糊输入B₁和B₂在像素级别上一致,还要与重渲染图R₁和R₂在结构上保持一致。由于R₁和R₂是从同一个3D表示G中渲染出来的,它们天然满足多视图一致性。因此,通过监督Ŝ₁和Ŝ₂去逼近R₁和R₂,网络被引导去生成一个“3D一致”的复原结果。这种约束比单纯的2D感知损失(如L1或L2损失)要强得多,因为它隐式地要求网络理解场景的3D结构。
值得注意的是,整个Stage 2中,NoPoSplat骨干网络是冻结的,不参与梯度更新。这意味着训练过程中,网络不会去适应NoPoSplat的特定行为,而是NoPoSplat作为一个固定的“3D先验”来提供引导。这种设计的好处是,训练过程更加稳定,且不需要大量的3D标注数据来微调骨干网络。同时,由于骨干网络是冻结的,推理时的计算图可以部分复用,提高了效率。

实验全面碾压:PSNR提升2.11dB的秘诀

实验设计也相当扎实。训练数据用的是DeepDeblurRF的合成相机运动模糊数据集,评估则在Deblur-NeRF的相机运动模糊子集上进行,包含5个合成场景和10个真实世界场景,共85个固定的评估元组(25个合成,60个真实世界)。
表1:新视角合成定量结果
表1:Deblur-NeRF真实与合成场景上的新视角合成定量结果。DAVANet和Difix3D+采用了与本方法相同的冻结pose-free 3DGS骨干网络。最优结果加粗显示,次优结果加下划线显示。
对比的方法也很有代表性:SE-GS做的是few-shot新视角合成的逐场景优化;GAURA是可泛化的稀疏模糊输入feed-forward方法;CoherentGS用了视频扩散先验加交替逐场景优化;DAVANet和Difix3D+则是本论文构造的“先复原再重建”基线——先分别用立体去模糊网络或扩散增强方法做2D复原,再接同一个冻结的NoPoSplat骨干做重建。
结果非常亮眼。在真实世界场景上,CasDeblurGS的PSNR达到21.13dB,比最强基线高了1.19dB;在合成场景上,PSNR达到23.41dB,比最强基线高了2.11dB。SSIM和LPIPS也全面领先。这里值得注意的是,即便同用NoPoSplat骨干,DAVANet和Difix3D+与最终方法之间的差距依然明显,这说明“先高质量2D复原再接3D重建”这条路本身就存在天花板——2D复原做得再好,也无法保证跨视图的3D一致性。
图3:新视角合成定性对比
图3:Deblur-NeRF数据集上真实与合成场景的新视角合成定性对比。上方的车辆场景为真实世界数据,下方的室内场景为合成数据。Inputs列显示两张模糊输入图。每个方法中,上图显示渲染的目标视角,下图放大红色框区域。
定性结果更是直观。看真实场景的车辆格栅区域,SE-GS和GAURA基本还在“云雾缭绕”的状态;CoherentGS和DAVANet有所改善,但细节被过度平滑;Difix3D+引入了一些结构伪影。CasDeblurGS恢复出的边界和结构,无论是锐利程度还是结构保真度,都最接近GT(Ground Truth,真实参考图)。
表2:消融实验结果
表2:真实世界场景上的消融实验。随着稳定器、Stage 1 2D引导和Stage 2 3D引导的逐步引入,各项指标持续提升。
消融实验也很有说服力。单独加稳定器只有小幅提升;加上Stage 1的2D引导后PSNR涨了0.58dB,这是最大的一笔增量;再加上Stage 2的3D引导,PSNR又涨了0.25dB,SSIM涨了0.016。这个渐进式的提升曲线,恰好印证了“从局部2D到全局3D”这一核心设计逻辑的有效性。
图4:渐进式消融可视化
图4:真实世界BlurBasket场景上的渐进式消融可视化。绿色线段表示输入视图间的跨视图2D匹配,红色箭头指向篮筐把手。可以看到随着级联流程的推进,跨视图匹配越来越密集,篮筐把手的结构也越来越完整清晰。
另一个值得关注的点是相机重投影分析。论文用重投影误差来衡量重建的几何一致性,并统计了多少像素能在另一视角中找到正确的对应。结果显示,CasDeblurGS的错误率比基线方法低不少,这说明级联2D到3D的引导策略不仅提升了渲染质量,还实打实地改善了多视图几何的一致性。
具体来说,论文在Deblur-NeRF的真实场景上,计算了重建的3D高斯在输入视角下的重投影误差。他们发现,CasDeblurGS的平均重投影误差比CoherentGS低了约15%,比DAVANet低了约20%。这意味着,CasDeblurGS重建出的3D场景不仅在视觉上更清晰,在几何上也更准确。这对于后续的下游任务(如导航、测量)至关重要。
此外,论文还进行了跨数据集泛化实验,将模型在DeepDeblurRF上训练后,直接评估在Deblur-NeRF上,没有进行任何微调。结果显示,CasDeblurGS依然取得了优于所有基线的性能,这证明了其良好的泛化能力。相比之下,一些逐场景优化的方法(如SE-GS和CoherentGS)在跨数据集评估时性能下降明显,因为它们需要针对每个新场景进行重新优化。

局限与展望:两视图重建的边界在哪里?

当然,CasDeblurGS并不是万能的。它的局限性也比较明显。
第一,两视图本身的信息量就是有限的。对于严重遮挡或视角差异过大的场景,即使2D对应关系和3D聚合都做得很好,也无法重建出完整的场景结构。第二,当前的骨干网络NoPoSplat是在RealEstate10K上训练的,这个数据集主要是室内和城市街景,对更广泛的场景类型泛化能力还有待验证。第三,OCGM的阈值参数τ和α虽然在实验中表现稳定,但在极端模糊或大位移情况下,如何自适应地调整阈值仍然是一个开放问题。
但反过来看,这个工作打开了一个很有想象力的方向。如果输入的视角数量从2个扩展到3-4个,级联的2D到3D引导策略可以很自然地扩展。另外,整个流程中所有模块都是冻结的,只有两个去模糊网络需要训练,这种“冻结骨干+轻量可训练模块”的范式,对于实际部署来说非常友好。
从应用角度看,这意味着未来手持设备也许只需要随手拍两张照片,就能生成一个可以自由视角浏览的3D场景——这正是XR、沉浸式远程临场和数字内容创作领域期待已久的能力。
另一个潜在的改进方向是处理动态场景。当前的CasDeblurGS假设场景是静态的,但现实世界中往往存在移动的物体。如果能够将光流估计与场景流(scene flow)估计结合起来,或许能够将方法扩展到动态场景。此外,如何利用视频序列中的多帧信息来进一步增强重建质量,也是一个值得探索的方向。
最后,从更宏观的视角来看,CasDeblurGS代表了一种趋势:利用大规模预训练模型(如NoPoSplat)作为先验,来解决传统上需要精确几何计算才能解决的病态问题。这种“数据驱动+几何约束”的混合范式,可能会在未来的3D视觉研究中扮演越来越重要的角色。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本论文提出CasDeblurGS:仅凭两张运动模糊图与相机内参,无需位姿、无辅助清晰图、无测试时优化,即可重建3D场景。
这篇工作最值得看的点是什么?在真实场景PSNR提升1.19dB,合成场景提升2.11dB,全面超越所有对比方法。
这篇工作的边界或风险在哪里?优点:1) 首次解决仅两张模糊图像的无位姿3D重建问题;2) 级联2D到3D引导策略新颖有效;3) 无需测试时优化,推理高效。缺点:1) 依赖已知相机内参;2) 极端模糊或大遮挡情况下光流估计可能失效;3) 两视图设置限制了场景覆盖范围。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出级联2D到3D的多视图一致性框架,通过遮挡感知的局部2D光流引导和全局3D重渲染引导,从仅两张模糊图像实现无位姿的3D高斯重建。

实验合理度:★★★★☆

PSNR、SSIM、LPIPS。

学术研究价值:★★★★☆

提出级联2D到3D的多视图一致性框架,通过遮挡感知的局部2D光流引导和全局3D重渲染引导,从仅两张模糊图像实现无位姿的3D高斯重建;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

推理时间65.52秒,无需逐场景优化。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;2) 级联2D到3D引导策略新颖有效;3) 无需测试时优化,推理高效。缺点:1) 依赖已知相机内参;2) 极端模糊或大遮挡情况下光流估计可能失效;3) 两视图设置限制了场景覆盖范围。

主要参考文献

[1] Choi H, Jang M, Kim I-G. CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images. arXiv:2608.10345, 2026.
[2] Kerbl B, Kopanas G, Leimkühler T, et al. 3D Gaussian Splatting for Real-Time Radiance Field Rendering. ACM TOG, 2023.
[3] Wang Q, et al. NoPoSplat: Feed-forward 3D Gaussian Splatting with No Pose. ArXiv, 2024.
[4] Teed Z, Deng J. RAFT: Recurrent All-Pairs Field Transforms for Optical Flow. ECCV, 2020.
[5] Chen X, et al. Real-Camera Blur Dataset and Deblur-NeRF. ICCV, 2023.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
📷 照片糊了别慌,两张图也能重建3D世界~
🎯 想第一时间get这类三维重建、图像恢复前沿好论文?
📚 加入『龙哥读论文』粉丝群,和志同道合的小伙伴一起读论文、聊落地!
👉 扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。