← 返回 PaperDaily 视觉与图像

Microsoft研究院新作Ink3D:视频生成把3D纹理“雕”复杂了

3D贴图最烦的不是“有没有”,而是“能不能把复杂花纹贴得像真的”。Ink3D的思路很直接:几何交给3D模型,纹理交给视频生成,再用烘焙把两边缝起来,工程味很足,也很有启发。

Microsoft研究院新作Ink3D:视频生成把3D纹理“雕”复杂了
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
3D贴图最烦的不是“有没有”,而是“能不能把复杂花纹贴得像真的”。Ink3D的思路很直接:几何交给3D模型,纹理交给视频生成,再用烘焙把两边缝起来,工程味很足,也很有启发。


原论文信息如下:
论文标题:
Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models
发表日期:
2026年07月
发表单位:
ZGCA & ZGCI, Microsoft Research, Zhejiang University, HKUST
原文链接:
https://arxiv.org/pdf/2607.01222v1.pdf
开源代码链接:
https://github.com/YueHan99/Ink3D.TextureGen
项目链接:
https://github.com/YueHan99/Ink3D.TextureGen

引言

3D生成进步很快,几何越来越像样,但纹理常“翻车”:文字糊成一团、格纹贴成抽象画。问题在数据——高质量3D纹理数据太少,模型学不到复杂外观规律。
Ink3D的解法很“工程派”:用现成3D模型搭白模,借助视频生成模型补足密集视角纹理信息,最后统一烘焙回网格。让擅长“看图说话”的视频模型干3D贴图的细活。

图1:Ink3D将几何感知的视频生成引入3D生成流程,用于合成极其复杂的纹理,例如精细服饰图案和高频装饰细节。
图1:Ink3D将几何感知的视频生成引入3D生成流程,用于合成极其复杂的纹理,例如精细服饰图案和高频装饰细节。

方法概述

核心思路:把3D生成拆成“先长骨架,再画皮肤”。骨架交给3D生成模型,皮肤交给大规模视频生成先验,最后通过纹理烘焙模块粘合。
图3:Ink3D的推理流程与TextureOptimizer示意图。
图3:Ink3D的推理流程与TextureOptimizer示意图。
输入一张参考图,用3D生成模型重建白色网格,再让OrbitPainter沿水平和垂直360度轨道生成视频,最后TextureOptimizer把密集视角“烤”回网格上。视频模型天生比3D模型更擅长学复杂外观,因为视频数据是海量级别。

图2:OrbitPainter概览。它以参考图和3D几何先验为条件,生成水平与垂直两条轨道扫描视频,并引入几何感知稀疏注意力来更好利用3D先验。
图2:OrbitPainter概览。它以参考图和3D几何先验为条件,生成水平与垂直两条轨道扫描视频,并引入几何感知稀疏注意力来更好利用3D先验。

OrbitPainter:360°环绕纹理视频生成器

OrbitPainter专门生成围绕物体旋转的轨道扫描视频,同时吃两类条件:参考图提供外观先验,白模渲染的法线图和三维位置图提供几何约束。训练时学水平与垂直轨道视频,视角覆盖更全,后面烘焙不易出现“缺一角”。
论文设计了Geometry-Aware Sparse Attention,利用3D位置把注意力限制在“同一表面附近”的token上,不让模型到处串门,只找“同一块皮肤”的邻居。这能压住相邻帧的轻微几何漂移,让轨道视频更像绕着同一个3D物体在转。

TextureOptimizer:消除伪影的神经烘焙术

直接投视频帧回网格会导致颜色渗开、纹理发糊。TextureOptimizer先把密集视角图像和白模几何做成体素颜色对应,再喂给Trellis-2做少量去噪——从“已经很像样的纹理里再修一遍”,更稳且保住细节。
体素和像素的对应关系被写成图匹配/马尔可夫随机场优化问题,让每个小体素挑最靠谱的视角像素,同时尽量和邻居颜色协调,使纹理边界更干净、复杂结构处颜色更稳定。

实验结果:复杂纹理生成的新SOTA

Ink3D在复杂纹理生成上明显优于现有开源方法,尤其在文字、花纹、装饰细节等场景。论文用FID、CLIP-FID、LPIPS和CLIP-I评估,整体优于Trellis-2等对比方法。
图A1:定性对比结果。
图A1:定性对比结果。
图A2:定性对比结果。
图A2:定性对比结果。
消融实验证明每个部件都在干活:去掉surface normal、3D position、几何感知稀疏注意力,指标都会掉,3D位置先验影响最大。

图A4:视频生成阶段的消融实验。分辨率和帧数下降后,多视角一致性会明显变差。
图A4:视频生成阶段的消融实验。分辨率和帧数下降后,多视角一致性会明显变差。
烘焙部分,直接平均烘焙或可微渲染会被多视角不一致拖后腿;TextureOptimizer更稳,对“密集视角里有点不老实的小偏差”处理得更好。

图A5:烘焙阶段的消融实验。TextureOptimizer在抑制模糊和颜色渗漏方面更有优势。
图A5:烘焙阶段的消融实验。TextureOptimizer在抑制模糊和颜色渗漏方面更有优势。

总结与未来展望

Ink3D最值得记住的是把老问题拆开:几何交给3D,纹理交给视频,融合交给烘焙。这种拆分符合真实工程逻辑,适合复杂纹理资产生产。代价是视频生成阶段仍慢,推理成本不低,更像是“高质量资产制作工具”,对游戏、影视、数字人等场景价值更明显。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

为什么不直接用现成3D模型自己学纹理?因为3D纹理数据太少,复杂纹理更少。视频模型见过的视觉模式多得多,用它补纹理相当于借了一个“见多识广”的外援。

OrbitPainter为什么要生成两条轨道视频?单一轨道容易看不全物体表面,水平和垂直两条轨道能补足视角覆盖,减少漏贴和模糊区域。

这套方法最适合什么场景?最适合对纹理细节要求高的3D内容生产,比如游戏资产、影视道具、数字人服装和带文字的物体。越怕“贴图翻车”的地方,越能看出它的价值。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆把视频生成先验引入3D纹理生成,围绕“密集视角+几何约束+神经烘焙”搭了完整链路,思路扎实。

实验合理度:★★★★☆有主结果、有消融,验证了几何先验、视频分辨率、帧数和烘焙策略的作用,实验逻辑完整。

学术研究价值:★★★★☆解决3D资产里很实际的纹理瓶颈,尤其是复杂图案和文字,属于一看就知道能落地的方向。

稳定性:★★★☆☆方法链条较长,视频生成一旦漂移后面都会受影响;TextureOptimizer把最后一公里补得还算稳。

适应性以及泛化能力:★★★☆☆主要围绕参考图到单物体纹理生成,面对更复杂场景时泛化边界还需验证。

硬件需求及成本:★★★☆☆推理要生成高分辨率双轨道视频,成本不低,不是“手机上随便跑”的级别。

复现难度:★★★☆☆思路清晰,但依赖较强的3D生成模型和视频生成模型,复现门槛主要在模型和算力。

产品化成熟度:★★★☆☆离工业级资产生产还有距离,但在高质量3D内容制作管线里已能看出明确产品价值。

可能的问题:整个流程对上游几何质量和视频一致性都比较敏感,若参考图、白模或轨道视频有偏差,最终纹理效果会被连锁放大。另一个现实问题是速度,效果很强但不算轻。


主要参考文献

Boykov, Y., Veksler, O., Zabih, R.: Fast approximate energy minimization via graph cuts. IEEE Transactions on Pattern Analysis and Machine Intelligence 23(11), 1222–1239 (2001).
Chen, D.Z., Siddiqui, Y., Lee, H.Y., Tulyakov, S., Nießner, M.: Text2Tex: Text-driven high-quality 3D scene texturing via 2D diffusion. In: ICCV (2023).
Hunyuan3D, T., Yang, S., Yang, M., Feng, Y., Huang, X., Zhang, S., He, Z., Luo, D., Liu, H., Zhao, Y., et al.: Hunyuan3D 2.1: From images to high-fidelity 3D assets with production-ready PBR material. arXiv preprint arXiv:2506.15442 (2025).
Li, W., Zhang, X., Sun, Z., Qi, D., Li, H., Cheng, W., Cai, W., Wu, S., Liu, J., Wang, Z., et al.: Step1X-3D: Towards high-fidelity and controllable generation of textured 3D assets. arXiv preprint arXiv:2505.07747 (2025).
Tang, S., Zhang, F., Chen, J., Wang, P., Furukawa, Y.: MVDiffusion: Enabling holistic multi-view image generation with latent diffusion. In: NeurIPS (2023).
Xiang, J., Chen, X., Xu, S., Wang, R., Lv, Z., Deng, Y., Zhu, H., Dong, Y., Zhao, H., Yuan, N.J., et al.: Native and compact structured latents for 3D generation. arXiv preprint arXiv:2512.14692 (2025).
Yuan, Z., Yu, X., Sun, Y.T., Guo, Y.C., Cao, Y.P., Liang, D., Qi, X.: SeqTex: Generate mesh textures in video sequence. arXiv preprint arXiv:2507.04285 (2025).

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!     🎨 3D贴图最怕“糊”和“裂”?Ink3D这类思路就很适合进星球继续拆。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),一起聊3D生成、视频模型和工程落地~

end
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。