← 返回 PaperDaily 视觉与图像

Restore3D来了:破损3D物体形状纹理一起修

这篇论文把“破损3D物体修复”从单纯补几何,推进到形状和纹理一起补,而且还要尽量保住原来没坏的部分。更狠的是,它不是只靠人工标注,而是把补哪里这件事也交给模型自己判断。

Restore3D来了:破损3D物体形状纹理一起修
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文把“破损3D物体修复”从单纯补几何,推进到形状和纹理一起补,而且还要尽量保住原来没坏的部分。更狠的是,它不是只靠人工标注,而是把补哪里这件事也交给模型自己判断。


原论文信息如下:
论文标题:
Restore3D: Breathing Life into Broken Objects with Shape and Texture Restoration
发表日期: 2026年07月
发表单位: 未知
原文链接: https://arxiv.org/pdf/2607.00522v1.pdf
项目链接: https://restore3dx.github.io

一、3D物体修复:一个被忽视的新挑战

3D世界里最烦人的事之一,不是“从零生成一个物体”,而是把一个已经坏掉的物体修好,还得尽量像原来那件。这听起来像修古董,实际上比“凭空造一个新东西”更难:既要补上缺口,还不能把原本没坏的部分改得面目全非。
这篇论文把这个问题正式命名为3D Object Restoration(3D物体修复):给定一个破损的3D物体,要同时恢复形状纹理,而且要尽量保留已经观测到的几何、颜色和风格。注意,这和常见的3D补全不一样。补全更像“把缺的那块拼上”,而修复更像“在不动原件的前提下做文物修复”,边界上的一点点漂移都可能让结果显得很假。
封面
图1:Restore3D面向破损3D物体的形状与纹理修复,目标不是“重新发明一个物体”,而是尽量把坏掉的部分补回去,同时保住原来没坏的地方。
难点主要有三个。第一是数据少,真实世界里很难拿到“破损—完整”成对3D样本。第二是破损形态太复杂,单靠简单补洞,常常会把原有结构一起改坏。第三是修复任务天然带着“保真偏执”:不仅要补对,还要保住原样,尤其是缺口边缘附近,最容易发生“补着补着把原来的也顺手抹了”的事故。

二、Restore3D:为“断臂维纳斯”续骨补衣,三步走

Restore3D没有把问题硬拆成“只补几何”或者“只补纹理”,而是直接把整条链路分成三段:先找伤口,再补图,再重建3D。这个思路很像修车:先判断哪儿坏了,再补漆补件,最后整车复检,而不是一上来就拿喷枪全车乱喷。
第一步是生成成对数据。论文用 Blender 的 Boolean 运算自动合成破损样本,再配合大规模3D数据集 G-objaverse 采样约8.3万件物体,构造出名为RestoreIt-3D 的数据。这里的关键不是“做数据”,而是“做出足够像真实破损”的数据。为了让破损更自然,作者还随机放入球体或立方体,控制大小和旋转,再用多视角渲染成32张图像,让模型从多个角度学习同一个坏物体的“前世今生”。
第二步是多视角图像修复。Restore3D没有直接拿单视角补图模型硬上,而是用多视角扩散模型作为底座,让不同视角之间能互相对齐。这里最重要的不是“补得像”,而是“补得一致”。因为3D物体一旦在不同视角里长出不同的补丁,最后重建出来的模型就会变成“多重人格”。
第三步是从高质量多视角图像恢复3D网格。论文采用大重建模型 LRM(Large Reconstruction Model,大规模重建模型),再用“粗到细”的方式继续打磨几何和纹理。先粗重建,再用法线先验修几何,最后把增强后的图像重新投影回纹理,这样输出的不只是一个“差不多像”的3D壳子,而是带纹理、能看细节的网格。
图2
图2:掩码在多视角修复中的重要性。单视角时,用户给一张掩码就够了;多视角时,每个角度都要一致地知道“哪儿坏了、哪儿该保留”,这件事人工做起来又慢又容易错。

三、自动感知“伤情”:深度感知掩码矫正器

这篇论文最有意思的地方,不是“能补”,而是连补哪里都能自己判断。这在多视角场景里很关键,因为手工给每个视角画掩码,基本等于给模型请了一个全职保姆,成本高还不稳定。
这里的核心模块叫Mask Self-Perceiver(掩码自感知器)。它基于多视角扩散模型,把图像特征和深度特征一起送进跨注意力层,让模型自己“看懂”哪些区域需要生成、哪些区域必须保留。深度特征来自 CLIP(Contrastive Language-Image Pretraining,对比语言-图像预训练)提取的深度/图像表示,再通过投影器映射到扩散空间。简单说,就是让模型别只看颜色,还得懂空间关系。
图3
图3:多视角图像修复。模型把图像、文本和空间掩码融合起来,自动感知缺失区域,并在保留原始部分的同时生成补全内容。
更关键的是Depth-Aware Mask Rectifier(深度感知掩码矫正器)。它不直接拿原始破损掩码去补,而是结合深度信息重新判断:哪些地方应该生成,哪些地方应该保留。这个设计很聪明,因为深度图更擅长表达形状和遮挡,而不是纹理细节。换句话说,深度图负责“骨架判断”,图像特征负责“皮肤判断”,两者分工明确,避免模型一股脑把原来好的部分也改坏。
论文还把这个矫正后的掩码继续用到后面的图像增强阶段。也就是说,掩码不是一次性的“临时草稿”,而是贯穿修复全流程的控制信号。这个设计的好处很直接:既能保住原有图案,又能减少边界缝隙和颜色突变。
图4
图4:基于矫正掩码的图像整合与增强流程。先把生成部分和保留部分拼起来,再做高分辨率增强和融合,尽量消掉拼接痕迹。

四、从粗到精:法线先验与图像增强雕琢细节

前面那一步把“能看”的多视角图像补出来了,但分辨率只有256×256。对3D重建来说,这个分辨率有点像拿放大镜看马赛克:大轮廓够了,细节就别指望太多。所以论文又加了一层图像增强,并把它和重建阶段连起来,形成“先补图、再精修”的链式流程。
增强阶段先用 Real-ESRGAN 把分辨率对齐,再把原图和补图按矫正掩码拼接,最后用 ControlNet-Tile 做细节补强。这里的思路很实用:Real-ESRGAN负责尽量不乱改结构地放大,ControlNet-Tile负责补局部纹理,但又不能把原有图案改飞,所以论文用掩码融合把两者“驯服”到同一条轨道上。
图5
图5:几何与纹理精修。粗重建结果先保底,再分别对几何和纹理做细化,让最终3D网格更像“修过的成品”,而不是“能用的草稿”。
重建阶段则使用 InstantMesh 这类大重建模型先得到粗网格,再做粗到细优化。几何部分引入法线先验,论文使用 StableNorm 这类表面法线估计模型提供更准确的表面方向信息;纹理部分则把增强后的图像通过 UV 坐标回投到网格表面,再做颜色优化。这样做的直觉很简单:几何不准,纹理贴上去也会歪;纹理不清,几何再准也像塑料模型。
从工程角度看,这个“先粗后精”的路线很务实。大模型负责兜底,专门模块负责补短板,避免把所有希望都压在一个单一模型上。对真实应用来说,这比“一个模型从头到尾全包”更靠谱,也更容易调参和替换组件。

五、全面碾压:多个数据集上的SOTA表现

先说结论:这篇论文的实验不是“挑一个好看的场景秀一下”,而是把修复、重建、泛化、消融都摆出来了,整体比较完整。数据集覆盖合成、物理模拟和真实破损物体,说明作者显然知道这个任务不能只在实验室的“理想碎片”上玩。
图6
图6:与图像修复方法的视觉对比。可以看到,传统方法往往依赖人工掩码,遇到大缺口时容易补歪;Restore3D更擅长自动感知缺失区域并保持多视角一致性。
表1
表1:与图像修复方法的对比。这里的结果说明,Restore3D在PSNR、LPIPS、FID和SSIM上都更稳,尤其是使用自预测掩码后,效果进一步提升,说明“先找准伤口”确实是关键。
更值得注意的是,Instant3Dit在使用本文预测掩码后,指标明显变好。这几乎等于论文自己给自己做了一个“反向证明”:不是所有问题都出在生成器本身,很多时候,真正卡脖子的反而是掩码不准。这也是为什么作者要专门做 Mask Self-Perceiver,而不是把掩码当成外部输入的附属品。
图7
图7:与重建方法的视觉对比。Restore3D输出的几何更完整、纹理更清楚,尤其在缺损边界和细节区域,优势更明显。
表2
表2:与重建方法的对比。Restore3D在PSNR、LPIPS、CD和F-Score上都拿到更优结果,说明它不仅补图好,最终落到3D网格上也更稳。
再看泛化。论文在真实破损物体数据集 Fantastic Breaks 和物理模拟破损数据集 Breaking Bad 上都做了测试。结果显示,虽然训练数据主要来自合成样本,但方法在真实场景里并没有直接“翻车”。这说明它学到的不只是某一种损坏模板,而是更通用的修复规律。
表3
表3:真实破损数据集上的泛化能力。Restore3D在PSNR、LPIPS和SSIM上都优于对比方法,说明它不只是“会做题”,也有一定“见过新题”的能力。
表4
表4:物理模拟破损数据集上的泛化能力。结果和真实数据集一致,说明方法对不同破损生成机制都有一定适应性。
表5
表5:多视角图像修复消融实验。没有掩码矫正器时效果明显下降;加上 Conv 和 DMR 后,指标继续提升,说明这两个模块不是“锦上添花”,而是实打实在干活。
表6
表6:多视角重建消融实验。粗网格初始化、几何精修和纹理精修都对最终结果有贡献,说明“先搭骨架、再抹细节”这条路是合理的。
表7
表7:图像整合与增强消融实验。单独放大、直接拼接、直接增强都不够稳,只有“放大—拼接—融合增强”这套组合拳,才能兼顾清晰度和原图保真。
图10
图10:与 Amodal3R 的对比。Restore3D更强调“破损物体修复”的完整链路,而不是只做局部补全。
图16
图16:破损率与性能关系。破损越严重,任务越难,但方法依然保持相对稳定,说明它不是只会修“轻伤”。

六、总结与展望:潜力无限,细节有待打磨

Restore3D最值得肯定的地方,是它没有把3D修复当成一个单点问题,而是把伤情识别、多视角补图、图像增强、3D重建连成了一条完整管线。这个设计非常工程化:每一段都在解决前一段留下的坑,逻辑是通的,结果也比较稳。
不过,它也不是“拿来就能无脑落地”的银弹。首先,训练数据仍然主要来自合成破损,真实世界的破损形态更乱、更脏、更不可控。其次,多视角生成和后续重建链路较长,推理成本不低。最后,这类方法对相机参数、多视角一致性和输入质量仍然比较敏感,想直接上生产环境,还得补一轮鲁棒性和效率优化。
但从研究角度看,这条路线很有启发:未来的3D修复大概率不会只靠一个“万能模型”硬扛,而是会越来越像一个模块化系统,把感知、生成、增强、重建拆开做精,再通过更聪明的控制信号串起来。Restore3D至少证明了一件事:修3D物体,不只是补洞,更是恢复“它原本应该长什么样”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“破损3D物体如何同时恢复形状和纹理,并尽量保留原有部分”这个更贴近真实场景的问题,不只是补几何,也不是单纯做3D生成。

Mask Self-Perceiver 和 DMR 分别在干什么?Mask Self-Perceiver负责自动感知哪些区域需要修复;DMR(Depth-Aware Mask Rectifier,深度感知掩码矫正器)负责结合深度信息,把“该补哪里、该保留哪里”判断得更准。

为什么还要做图像增强和法线精修?因为多视角补图通常分辨率不高,直接重建会让细节发糊;先增强图像、再用法线先验修几何,能让最终3D网格更清楚、更稳定,也更接近真实物体的表面结构。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把“自动感知修复区域”引入破损3D物体修复,再串起多视角补图、增强和重建,思路完整,不是小修小补。

实验合理度:★★★★☆。对比方法、泛化数据集、消融实验都比较齐,尤其证明了掩码质量确实是关键变量。

学术研究价值:★★★★☆。它把3D修复从单纯补全推进到“保真修复”,对后续研究有明确启发。

稳定性:★★★☆☆。合成数据训练能泛化到真实场景是优点,但链路较长,对输入质量和相机参数仍有依赖。

适应性以及泛化能力:★★★★☆。在真实破损和物理模拟破损上都能跑出不错结果,泛化能力不差。

硬件需求及成本:★★★☆☆。多视角扩散加重建加增强,推理链路不短,算力和时间成本都不算低。

复现难度:★★★☆☆。模块较多,数据合成、重建和增强都要配齐,工程复现门槛中等偏上。

产品化成熟度:★★★☆☆。适合文化遗产修复、数字资产补全等场景,但离“通用在线修复服务”还有距离。

可能的问题:训练数据偏合成,长链路推理成本高,真实复杂破损和极端材质下的鲁棒性仍需进一步验证。


主要参考文献

Restore3D: Breathing Life into Broken Objects with Shape and Texture Restoration. arXiv:2607.00522v1, 2026.
Project Page: https://restore3dx.github.io

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
断裂的3D物体能补骨、补皮、补纹理,前沿论文也能一起补课。欢迎来群里继续聊 Restore3D、3D修复、重建和多视角生成~
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。