← 返回 PaperDaily
视觉与图像
3D纹理超分新SOTA来了!自适应视角+扩散模型,浙大这一招让老旧资产秒变4K
你是不是也遇到过这种尴尬:下载了一个精美的3D模型,结果纹理一放大全是马赛克,UV接缝处裂开得像补丁?传统图像超分模型拿到纹理图上直接翻车,生成模型又一味“自由发挥”不保留原细节。浙大团队这次祭出Texture++,用“自适应视角+四叉树掩码+局部单步扩散”三板斧,既保真又无缝,4倍超分PSNR飙到37.53,比SOTA高出1.5个dB,关键是——不需要梯度
龙哥读论文
阅读 4
查看原文
原论文信息如下:
3D纹理太糊?一招超分神器Texture++,细节拉满无接缝!
想象一下,你翻出了一个压箱底的经典3D模型,比如《魔兽世界》里的老套装备模型,或者十几年前游戏里那个精致但纹理糊成一片的“古董”角色。一渲染出来,那些边缘的马赛克和明显的UV接缝直接让你梦回2005。扔掉可惜,重做又太贵,模型库里的“老旧资产”简直成了数字时代的鸡肋。
把这堆糊图交给现在那些顶级的2D图像超分辨率模型处理呢?结果更让人头疼——接缝处直接裂开,图案对不上,就像把一块撕裂的拼图硬塞进高清扫描仪。
别急,浙江大学CAD&CG国家重点实验室团队出手了,他们提出的 Texture++ 专治各种不服。这个框架不仅能把低分辨率的纹理提升到接近真实世界的精细度,还几乎看不出任何接缝!先看个视觉震撼:
从UV接缝到完美融合:自适应视角+四叉树掩码如何搞定纹理超分?
为什么直接拿2D图像超分模型处理纹理图会失败?核心问题在于 UV unwrapping(UV展开)。这个过程会把一个连续的三维表面切割成多个独立的二维片(叫做 UV charts或者UV islands)。在三维空间里紧挨着的两个面,在二维纹理图里可能相隔十万八千里。2D超分模型压根不懂3D拓扑,它只会在这些小片内部暴力修复,结果就是接缝处断裂、图案错位,如图2所示:
Texture++ 的巧妙之处在于,它把纹理超分问题换了个赛道——从纹理空间(UV空间)转移到了视图空间(view space)。简单说,就是不直接处理那张乱七八糟的纹理贴图,而是先渲染出多张不同角度的3D模型观察图像,在这些连续的、自然的图像上做超分,然后再把清晰的结果合并回纹理贴图。
这个思路好是好,但新问题跟着就来了:一个3D模型需要渲染多少视角?从哪些角度渲染才算好?不同视角超分结果冲突了怎么办?Texture++ 祭出了“自适应视角选择+四叉树掩码正则化”的组合拳。
自适应视角选择:把一个完整的图案放在一张视图里超分是最理想的,因为图像SR模型能利用全局的上下文信息。基于这个直觉,Texture++ 把视角分为两类:UV图表内视角 和 跨UV图表视角。前者专门对准单个UV岛,保证岛内的纹理模式能最佳角度、最完整地呈现;后者则专门对准那些有接缝的区域,让原本在纹理图上分开的图案在视图里拼回去,生成连贯的超分结果。
四叉树掩码生成机制:视角选好了,渲染了一张融合好的视图,但总不能每个像素都超分一遍吧?这既浪费计算资源,又容易把本来清晰的区域搞糊。Texture++ 引入了一个全局质量图(global quality map),记录纹理上每个像素目前已经达到的最高质量。当要处理一个新视角时,它会对比当前视角的渲染质量与历史最佳质量。只有那些当前视角比历史记录拍得更清晰、更正面的区域,才会被标记为需要超分的区域,生成一个二值掩码(mask)。
这个掩码如果处理不好,边界会非常碎片化、锯齿状,扩散模型(Diffusion Model)拿到这种掩码会怎么想?“咦?这个锯齿形状是纹理的一部分吗?我要不要把这个边界也超分一下?”结果就会产生新的边界伪影。为此,Texture++ 用了一个 四叉树(Quadtree) 正则化策略:递归地将掩码区域分割成四个子块,直到子块内全是0或全是1,或者小到不能再分。最终把杂乱的碎片整合成一个个干净的矩形块,给扩散模型提供了一个清晰、稳定的“作业范围”,让它只在这个范围内干活。
单步扩散+局部增强:这个SR模型既快又准,还不会破坏周围纹理
拿到视图和对应的干净掩码后,就该主角上场了: 局部超分(Local SR)扩散模型。
传统扩散模型做超分,通常需要多步迭代去噪,速度慢,而且它会把整张图都处理一遍——包括那些本就很清晰的区域。这就麻烦了,一个视图里,很可能有些地方在之前的迭代中已经被超分得很好了,现在又拿过去跑一遍,不仅浪费,还容易引入新的不一致。
Texture++ 这里给出的方案非常优雅:单步(single-step)局部扩散。
具体怎么做的呢?它们基于 Stable Diffusion 2.1-base (SD) 模型进行微调。首先,将低分辨率图像通过一个冻结的VAE编码器变成潜空间特征 `z`,然后把二值掩码 `M` 作为额外的条件通道,直接拼接到这个潜特征上(维度从4变5),喂给U-Net。
关键在于,U-Net 被训练成去预测一个潜空间的 残差(residual) `Δz`,而不是直接预测噪声。最终的输出潜特征等于 `z` 减去 `Δz`。这个残差预测配合掩码,完美实现了两个目标:
1. 精准定位:模型只有在 `M=1` 的区域才会去预测有意义的高频残差;对于 `M=0` 的区域,模型被告知“这里应该保持不变”,避免了破坏已有细节。
2. 高效推理:因为残差预测是一步到位的,不需要多次迭代去噪,推理速度极快,跟其他扩散模型动辄几十步的耗时形成鲜明对比。
为了让模型效果和边界更自然,它们还用了 LoRA (Low-Rank Adaptation, 低秩适应) 技术微调了两个适配器:一个负责恢复高保真内容,另一个专注于边界区域的平滑融合。损失函数也是差别的,使用了掩码版本的均方误差(MSE)和感知损失(LPIPS),让模型主要关注掩码内部的重建质量。
最后,通过一个简单的直接投影(direct projection)机制,把局部超分后的图像更新回高分辨率纹理贴图。整个迭代循环如图5所示,颜色越多的区域代表迭代次数越多,纹理细节逐步累积提升:
全面碾压SOTA:4倍超分PSNR提升1.5dB,图像和纹理生成基线统统败北
光说不练假把式,咱们直接看实验结果怎么打脸各路SOTA的。为了公平比较,论文挑了一堆重量级选手作为基线。
图像超分基线:包括 DiffBIR、HYPIR、OSEDiff、PiSASR、InvSR,这些都是当前扩散模型和高效超分领域的顶尖方法。
纹理生成基线:包括 Text2Tex、Paint3D、MVPaint。这些方法都有粗到细的“精炼”阶段,把它们原本的输入换成低分纹理,用它们的精炼阶段来做超分。
- PSNR(峰值信噪比):Texture++ 达到 37.53,比第二名的 DiffBIR(35.94)高出整整 1.59 dB。PSNR通常反映像素级重建的准确性,这个接近1.6dB的提升在图像/纹理恢复领域已经是非常显著的。对于经验丰富的工程师来说,这意味着模型不仅看起来更好,而且在数值上严格地更接近真实纹理。
- LPIPS(学习感知图像块相似度):Texture++ 的 0.0637 也大幅领先第二名的 PiSASR(0.0866),说明模型生成的纹理在人类视觉感知上更逼真、更自然。
- 速度:尽管是迭代式的,但得益于单步扩散和视图空间(1K分辨率)的局部处理,完全体Texture++处理一个模型仅需 94.4秒,远快于大部分需要直接处理高分辨率纹理(2K)的基线方法。相比之下,DiffBIR 需要 586.2 秒,MVPaint 也需要 215.6 秒。
图像超分模型(DiffBIR, HYPIR)在UV接缝处全都崩了,产生了明显的“接缝线”;而纹理生成方法(MVPaint, Text2Tex)在保真度上不行,要么过度平滑把文字抹掉,要么直接毁坏原有的图案结构。只有 Texture++ 完美保留了接缝处的连续性和精细文字。
论文还额外测试了对不同UV展开方式的鲁棒性,即使UV岛的分布、接缝位置大不相同,PSNR和SSIM的方差也极小(表3),证实了Texture++出色的泛化能力。
消融实验见真章:视角选择、掩码正则化、局部SR缺一不可
为了验证各个模块的必要性,论文做了详细的消融实验:
- 移除自适应视角选择(w/o v.s.):改用随机视角。结果视觉上接缝处崩得惨不忍睹,因为相邻纹理区域在不同视角下被超分得不一致,破坏了表面拓扑的连续性。
- 移除四叉树掩码正则化(w/o quadtree):直接使用碎片化的原始掩码。LPIPS有所上升,视觉上边界伪影显著。
- 移除掩码局部SR(w/o mask):使用标准的整图超分模型代替局部SR模块。即使有掩码指示,标准模型也无法只处理局部,导致锐利的区域被重新处理,变得模糊。
数据很直观:单独去除任何一块,PSNR都会明显下降;LPIPS则更敏感,特别是去掉四叉树或者掩码条件,感知质量会显著退化。这验证了论文“三板斧”思路的正确性——视角选择解决跨接缝的连续性,四叉树解决边界干净度,局部掩码SR解决重叠区域的稳定更新。
龙迷三问
Texture++ 的核心创新是什么,和现有方法最大的区别在哪里?最大的区别在于,Texture++ 把纹理超分从“纹理空间”搬到了“视图空间”,并设计了一套自适应的视角选择+掩码机制+单步扩散的方案,解决了直接超分纹理图带来的接缝问题和多视图超分带来的不一致问题。不同于现有方法(如 PBRSR)那样需要通过梯度优化来回迭代更新,Texture++ 是端到端、一次性的(通过单步扩散),也不需要像某些纹理生成方法那样“从零生成”,而是严格保持和增强原始纹理的细节。
文中的全局质量图(Q_global)和局部质量图(Q_n)具体是如何计算的,以及如何决定哪个区域需要更新?局部质量图 Q_n 针对每个视角的每个像素,按公式 `Q = ( (v* · N) * (1/d^2) )` 计算。其中 v* 是视角方向, N 是表面法线(用于评估视角是否正对物体), d 是相机到表面的距离(用于评估清晰度)。全局质量图 Q_global 则累积所有迭代中每个纹理像素获得的最佳评分。当前视角生成的掩码 M_n,是通过比较新视图的 Q_n 与全局的 Q_global 来确定的:只有当新视图对某个像素的评分更高时,才认为该像素需要在本轮更新。这样就确保了纹理更新是单调递增且高效的。
Texture++ 的局限性在哪里,什么场景下不适用?主要局限性在于几何自遮挡。如图11所示,如果一个模型的某个区域(如角色的背面)被自身的其他部分(如盔甲)完全挡住,那么在所有的观察视角中都看不到这块区域,就无法进行超分更新。此外,对于具有极其复杂的UV布局的模型,自适应视角选择策略的计算开销可能增加。最后,虽然单步扩散很快,但整体迭代流程(多个视角轮流处理)对于需要极高帧率的实时渲染来说,仍可能是一定的开销。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★★
把扩散模型用在视图空间来做3D纹理超分,再加上自适应视角和四叉树机制,思路新颖,解决了2D超分模型不能处理3D纹理的痛点。这套组合拳不常见,创新性很强。
实验合理度:★★★★★
对比的基线非常全面且都是当前SOTA,涵盖图像超分(DiffBIR, HYPIR等)和纹理生成(Paint3D, MVPaint等)两大赛道。定量和定性图表都很充分,消融实验设计也直指要害,说服力强。
学术研究价值:★★★★★
开辟了纹理超分的新范式,给3D资产复用、游戏行业老旧模型焕新提供了可行的解决方案。论文中对UV接缝、多视图一致性问题的处理思路,对后续研究有很强的启发性。
稳定性:★★★★☆
自遮挡区域是短板,但这是几乎所有多视图方法的通病。在可见区域,性能非常稳定。鲁棒性测试(不同UV展开方式)证明了其泛化能力。总体稳定性高。
适应性以及泛化能力:★★★★★
对不同UV布局、不同类型(几何、角色、物体)的模型都有很好的重建效果。核心框架基于Stable Diffusion,对主流的模型和渲染管线兼容性好。适应性很强。
硬件需求及成本:★★★★☆
训练需要3张A6000(48G),推理只需1张A6000。虽然单步扩散很快,但迭代式渲染流程有一定算力开销。不过相比动辄几百秒的DiffBIR,已经非常高效。对于有专业显卡的工作室很友好。
复现难度:★★★☆☆
代码暂未完全开源(论文提到使用了自定义数据集和LAMA模型),视图渲染涉及Nvidiffrast等库,环境配置可能有一定门槛。但整体框架清晰,核心扩散模型可基于SD微调。期待后续开源。
产品化成熟度:★★★★☆
非常贴近实际应用场景,已经接近产品级。虽然处理一个物体需要近100秒,但对于离线内容生产和资产库升级来说完全可接受。目前主要挑战是自遮挡问题,以及需要进一步对PBR材质(如法线、粗糙度贴图)做适配。
可能的问题:论文中提及的训练数据(自定义配对纹理数据集)细节不够,对于复现带来一定困难。另外,对于自遮挡区域,论文只是陈述问题,没有提出进一步的补救方案。整体瑕不掩瑜。
主要参考文献
[1] Shuaiwei Wang, Shi Li, Jieting Xu, Yuchi Huo, Qi Wang, Wenting Zheng, and Rengan Xie. 2026. Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model. ACM Trans. Graph. 1, 1 (July 2026), 16 pages. https://doi.org/10.1145/nnnnnnn.nnnnnnn
[2] Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR.
[3] Lin, X., et al. (2024). DiffBIR: Towards Efficient Blind Image Restoration with Diffusion Models. arXiv.
[4] Zeng, Y., et al. (2024). Paint3D: Paint Anything 3D with Lighting-Less Texture Diffusion Models. CVPR.
[5] Chen, D., et al. (2025). PBRSR: Zero-Shot 3D Texture Super-Resolution via Photometric-Based Rendering. arXiv.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
想给你的3D模型也来一次「美颜」吗?纹理超分、UV接缝修复、4倍细节拉满——这些实用技巧都在龙哥读论文粉丝群里!
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 纹理超分+北京+浙大+龙哥),根据格式备注重,可更快被通过且邀请进群哦!