← 返回 PaperDaily 视觉与图像

多伦多大学最新研究:黑暗中的3D重建,信噪比低于-4dB也不怕!

黑暗环境下的3D重建一直是计算机视觉的"禁区"——常规的SfM管线在低信噪比下直接崩溃。多伦多大学带来的Dark3R另辟蹊径,通过教师-学生蒸馏把MASt3R这类3D基础模型"教会"在黑暗中看清世界,仅需噪声-干净RAW图像对训练,无需任何3D真值监督。看过的龙迷都直呼"真不错"!

多伦多大学最新研究:黑暗中的3D重建,信噪比低于-4dB也不怕!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
黑暗环境下的3D重建一直是计算机视觉的"禁区"——常规的SfM管线在低信噪比下直接崩溃。多伦多大学带来的Dark3R另辟蹊径,通过教师-学生蒸馏把MASt3R这类3D基础模型"教会"在黑暗中看清世界,仅需噪声-干净RAW图像对训练,无需任何3D真值监督。看过的龙迷都直呼"真不错"!


原论文信息如下:

论文标题:
Dark3R: Learning Structure from Motion in the Dark

发表日期:
2026年03月

发表单位:
University of Toronto, Vector Institute, York University, Sony Corporation of America, Harvard University, Purdue University

原文链接:
https://arxiv.org/pdf/2603.05330.pdf

项目链接:
https://andrewguo.com/pub/dark3r

开源代码链接:
https://github.com/andrewyguo/Dark3R

黑暗中的场景重建:一种基于教师-学生蒸馏的鲁棒SfM新框架

你试过在伸手不见五指的地方拍照片吗?不是那种“调高ISO还能看见”的暗,而是信号比噪声还低的极端弱光——图像信噪比(SNR)跌到4 dB以下,甚至低至-5 dB。传统方法(如COLMAP)会直接罢工,因为提取到的特征点大多是噪声。即便把当前最先进的3D基础模型MASt3R直接怼上去,也会因训练数据分布差异而崩溃。
多伦多大学与索尼、哈佛等机构合作,提出Dark3R框架,专门解决“黑暗中”的SfM问题。核心思路:既然MASt3R在亮光下能精准预测3D点图和特征对应,那能不能把它“教会”在弱光下也做同样的事?通过教师-学生知识蒸馏,Dark3R把MASt3R在干净图像上的能力迁移到噪声图像上,训练完全不需要3D标注,只需成对的噪声-干净RAW图像。这相当于给3D基础模型戴上了一副“夜视镜”。
Figure 1
图1:Dark3R在弱光下从RAW图像中恢复相机位姿和3D场景几何,并实现新视角合成。 (a) 拍摄500张不同视角的低光图像;(b) Dark3R预测的相机位姿;(c) 结合由粗到精优化策略的鲁棒视图合成,恢复出被噪声掩盖的细节。

从噪声中提取精确位姿:Dark3R如何克服低信噪比挑战

想在弱光下做SfM,最直接的思路是先降噪再用常规流程。但独立降噪会破坏多视图一致性,爆反降噪又要求帧间运动小。Dark3R选择从源头解决问题:直接在噪声RAW图像上学习特征匹配。
Dark3R的基石是MASt3R——一个基于ViT的3D基础模型,输入一对图像就能输出逐像素的3D点图和对应特征。Dark3R保留完整架构,但用一个学生网络适配噪声输入。教师网络(冻结)处理干净RAW图像对,学生网络处理噪声RAW图像对,通过最小化编码器、解码器和对应图上的特征距离进行蒸馏。损失函数为L_distill = ||F_enc_clean - F_enc_noisy||² + ||F_dec_clean - F_dec_noisy||² + ||C_clean - C_noisy||²。同时加入辅助一致损失L_clean,完整损失L = L_distill + 0.3 * L_clean。训练采用LoRA微调,在8块RTX A6000上约15小时完成。
推理时,Dark3R对一组噪声RAW图像逐对预测特征,然后构建共视性图、进行粗对齐和全局光束法平差,最终恢复出相机位姿和稀疏点云。所有处理都在RAW域进行,不做黑电平裁剪,因为弱光下像素均值接近黑电平,裁剪会丢掉宝贵信号。
Figure 3
图3:方法概览。(a) 训练阶段:使用配对的干净/噪声RAW图像对,教师网络(冻结)处理干净对,学生网络(带LoRA微调)处理噪声对,通过特征蒸馏进行监督。(b) 推理阶段:预测的位姿和深度图用于由粗到精的辐射场优化。
随着SNR从0 dB下降到-7 dB,MASt3R-SfM的平移误差和旋转误差急剧上升,而Dark3R的退化曲线平缓得多。在极低SNR(如-5 dB)下,Dark3R的绝对深度误差仍能控制在0.2以内,而MASt3R-SfM已飙到0.5以上。
Figure 4
图4:位姿预测评估。Dark3R(蓝色)与MASt3R-SfM(灰色)在平移相对误差、旋转相对误差、绝对相对深度误差和精度阈值四个指标上的对比。随着SNR下降,Dark3R在所有指标上均优于基线。
点云重建的定性结果更直观——Dark3R恢复的相机轨迹与参考高度重合,而MASt3R-SfM的轨迹严重偏离,重建的几何也支离破碎。
Figure 5
图5:两个弱光场景下的点云和相机位姿对比。Dark3R(紫色)恢复了更准确的几何和与参考轨迹(绿色)更对齐的相机路径,MASt3R-SfM(橙色)则产生明显偏差。

辐射场重建新思路:结合由粗到精优化与深度监督

有了Dark3R估计的位姿和深度图,作者设计了一套由粗到精的优化策略,结合深度监督,称为Dark3R-NeRF。核心技巧是“随机预处理”——在优化NeRF时,给每条光线采样点的位置加入高斯噪声,噪声标准差从1×10⁻³逐渐退火到0(前30k步),之后继续优化至90k步。这相当于让网络从“看模糊图”开始,慢慢精准到“看清细节”。此外,Dark3R预测的深度图被用来作为深度监督,损失权重随优化过程指数衰减。输入不做黑电平裁剪,依靠多视角的测量积累来提升有效SNR。
实验表明,Dark3R-NeRF在所有噪声水平下均优于RawNeRF和LE3D。消融研究显示,深度监督贡献约1.3 dB的PSNR提升,随机预处理贡献约0.12 dB,避免黑电平裁剪也带来了可感知的质量改善。
Figure 6
图6:新视角合成对比。Dark3R-NeRF在PSNR和LPIPS上均保持最高质量,且随噪声增加退化最慢。
Table 4
表4:视图合成消融研究。深度监督、随机预处理和未归一化的RAW输入对PSNR、SSIM、LPIPS的影响。完整提出的Dark3R-NeRF获得最佳结果。

大规模曝光包围数据集:为低光3D重建提供基准

作者构建了一个前所未有的多视图RAW图像数据集,全部使用索尼Alpha I相机(50 MP)拍摄,共超过100个场景、63,000张图像。数据集分为两部分:手持拍摄数据集(21,688张干净RAW图像,92个室内场景)和三脚架拍摄曝光包围数据集(41,967张RAW图像,12个场景,每个场景9档曝光,最低两档SNR低于0 dB)。训练时,手持数据集全部用于训练,三脚架数据集中7个场景用于训练,5个场景作为测试。所有图像下采样并中心裁剪至512×352。这个数据集填补了弱光3D重建领域benchmark的空白。
Figure S2
图S2:数据集中每个场景的不同曝光设置,共9档曝光,覆盖从亮到极暗的宽SNR范围。
Table S2
表S2:数据集中12个场景的统计,包括图像数量、环境类型、训练/测试划分。

跨设备泛化与未来展望

Dark3R的一个惊喜特性是它对别的相机传感器也能泛化——在iPhone 16拍摄的RAW图像上,不经过任何微调,Dark3R的位姿精度依然显著优于MASt3R-SfM。这得益于在RAW域的训练:不同传感器的噪声模型虽然不同,但RAW数据的线性特性让模型学到的特征具有一定的鲁棒性。此外,Dark3R能自然地支持HDR渲染。
未来,Dark3R可以扩展到视频SfM、动态场景重建等方向。目前的一个局限是,学生网络仍依赖教师网络的架构,如果教师本身在极低SNR下有偏差,蒸馏效果也会受限。此外,在完全没有光照(SNR<-10 dB)的条件下,极限性能仍有待探索。
在平均SNR -3.87 dB的测试场景上,Dark3R的ATE仅为0.050,相比第二名的MASt3R-SfM(0.088)接近减半。
Table 1
表1:相机位姿估计结果。测试场景平均SNR -3.87 dB。Dark3R在ATE、RPE平移、RPE旋转、深度误差等指标上全面领先。
视图合成结果同样印证了优势——Dark3R-NeRF搭配Dark3R位姿,PSNR达到36.17 dB,超过MASt3R-SfM+Dark3R-NeRF的34.60 dB和LE3D的35.77 dB。
Table 2
表2:视图合成结果。Dark3R-NeRF搭配Dark3R位姿在PSNR、SSIM、LPIPS上均优于其他组合,逼近Oracle上限。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Dark3R的教师-学生蒸馏为什么不需要3D标注?因为教师网络(预训练的MASt3R)本身就能对干净图像输出可靠的3D点图和特征对应,学生网络只需要模仿教师的输出特征,而不需要知道真实的3D结构。训练只需要成对的噪声-干净RAW图像,这些很容易通过合成噪声或短曝光拍摄获得。

为什么要在RAW域而不是sRGB域操作?RAW图像是线性传感器响应,保留了完整动态范围。而sRGB经过ISP后,包含了非线性映射、黑电平裁剪等不可逆操作,在弱光下会严重破坏信号。实验也证实,在RAW域微调比在sRGB域微调性能更好。

为什么不用3D Gaussian Splatting (3DGS)做视图合成?作者尝试了LE3D,但在高噪声水平下,高斯点的优化陷入局部最优,产生了大量伪影。而NeRF通过连续辐射场表示和由粗到精的噪声退火策略,能更自然地聚合多视角信息。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

将3D基础模型通过蒸馏迁移至弱光域,思路清晰且有效,首次系统解决低光SfM。

实验合理度:★★★★★

对比了多个基线,包含消融研究、跨设备泛化等,实验全面且公平。

学术研究价值:★★★★★

开创了低光SfM新领域,提供了数据集和基线结果,具有里程碑意义。

稳定性:★★★☆☆

在SNR -5 dB以上表现稳定,更低SNR下误差仍会增大。

适应性以及泛化能力:★★★★☆

在iPhone 16上无微调表现良好,有跨传感器泛化能力。

硬件需求及成本:★★★☆☆

训练需8×A6000(约15小时),推理端需GPU运行ViT模型。

复现难度:★★★★☆

代码和数据集已开源,训练数据合成方法清晰。

产品化成熟度:★★☆☆☆

目前仍处于研究阶段,直接落地还有距离,但核心思路可用于开发轻量版。

可能的问题:MASt3R模型较大,推理速度可能成为瓶颈;对动态场景未做评估;蒸馏依赖教师模型的泛化边界。


主要参考文献

[16] J. L. Schönberger et al. MASt3R-SfM: a fully differentiable structure-from-motion pipeline. CVPR, 2026.
[25] E. J. Hu et al. LoRA: Low-Rank Adaptation of Large Language Models. ICLR, 2022.
[33] P. Leroy et al. MASt3R: 3D foundation model from stereo pairs. ECCV, 2024.
[42] B. Mildenhall et al. RawNeRF: Neural Radiance Fields in the Raw. SIGGRAPH, 2022.
[51] J. L. Schönberger et al. Structure-from-Motion Revisited. CVPR, 2016.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
告别伸手不见五指的场景重建烦恼!Dark3R竟能让AI在极低光照下看得清清楚楚。加入龙哥读论文粉丝群,和数千同路人一起追踪最前沿的3D视觉与图像恢复技术。扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。快来一起get这项硬核黑科技吧!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。