← 返回 PaperDaily 视觉与图像

阿里Home3D 1.0:一张图生成可编辑3D家具

Home3D 1.0 不是单纯“把图变成 3D”,而是把家具商品化这件事拆成几道硬菜:几何、纹理、材质、部件,各管一摊。最有意思的是,它把“可编辑”放到了和“像不像”同等重要的位置,这才像真正面向设计和电商的方案。

阿里Home3D 1.0:一张图生成可编辑3D家具
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
Home3D 1.0 不是单纯“把图变成 3D”,而是把家具商品化这件事拆成几道硬菜:几何、纹理、材质、部件,各管一摊。最有意思的是,它把“可编辑”放到了和“像不像”同等重要的位置,这才像真正面向设计和电商的方案。


原论文信息如下:
论文标题:
Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design
发表日期:
2026年06月
发表单位:
Alibaba Group / Taobao Home3D-team
原文链接:
https://arxiv.org/pdf/2606.27923v1.pdf

从一张照片到手捏可编辑3D模型,Home3D如何做到?

一句话概括,Home3D 1.0 干的不是“把图变成一个差不多的 3D 摆件”,而是把家具和家居饰品做成了能看、能改、还能直接进设计流程的商品级 3D 资产。这个目标听起来朴素,实际很难:家具不像路边石头,少一条腿、歪一个角、材质糊成一团,设计师就会直接把它踢出项目。
封面
图1:Home3D 1.0 生成的客厅场景示意。它展示的不是单个“看起来像”的物体,而是一整套能塞进室内设计场景里的家具资产。
这篇论文最有意思的地方,不在于它又造了一个“图生3D”模型,而在于它把这个问题拆成了四个互相咬合的模块:几何、纹理、PBR材质、材质感知部件。前两个解决“像不像”,后两个解决“能不能用”。这一下就把很多只会生成漂亮渲染图的方案,按在了工程地板上。
图2:Home3D 1.0 系统总览
图2:Home3D 1.0 系统总览。输入一张参考图后,系统依次完成几何重建、纹理补全、PBR 材质检索和部件生成,最终输出可编辑的 3D 资产。
它的工作流并不玄乎。先用几何模块重建一个封闭网格,再用纹理模块补足表面颜色,接着用材质模块把表面拆成不同材质区域并检索 PBR(Physically-Based Rendering,基于物理的渲染)贴图,最后再生成材质可编辑的部件网格。PBR 这三个字很重要,因为它不是“贴个花纹就完事”,而是把金属度、粗糙度、法线这些会影响真实光照反应的属性一起补上。说白了,Home3D 追求的是“看起来像真货”,不是“截图里还行”。

不只“像”,更要“真”:几何、纹理与PBR材质的三位一体

先看几何。家具生成最怕“外形大差不差,细节全跑偏”。一把椅子如果腿粗了一圈、靠背弧度歪了、桌面边缘糊掉,放进室内场景就会显得特别假。Home3D 的几何模块用的是latent SDF路线:SDF 是 Signed Distance Field,中文叫有符号距离场,它表示空间里每个点到物体表面的距离,正负号还能区分点在物体内外。这样做的好处是,几何不再只是“点云拼图”,而是有了连续、可查询的隐式表示。
图3:几何生成框架概览
图3:几何生成框架概览。左边是几何 VAE 编码与解码隐式表面,右边是图像条件下的 coarse-to-fine DiT 生成流程。
这里的 VAE 是 Variational AutoEncoder,中文叫变分自编码器;DiT 是 Diffusion Transformer,中文可理解为扩散式 transformer。论文没有把这些术语拿来装腔,而是用得很实在:VAE 负责把复杂几何压缩成紧凑潜变量,DiT 负责从噪声里生成这个潜变量。更关键的是,它还做了粗到细两阶段:先生成全局轮廓,再细化薄腿、边角、局部曲率这些容易翻车的地方。这个思路很像先把家具“搭骨架”,再去雕边角,工程上比一口气硬生成整张网格稳得多。
几何VAE编码公式
上面这条公式表示:输入的表面点云 P 会经过编码器变成潜变量 Z。其中 CrossAttn 是交叉注意力,意思是 anchor queries 会去“看”点云特征,把局部几何信息整合成全局 latent 表示。
SDF解码公式
这条公式说明,任意空间点 x 都可以通过解码器映射成一个 SDF 值 s(x)。当 s(x)=0 时,就是物体表面;再用 Marching Cubes 提取零等值面,就能把隐式表示变成可渲染网格。
纹理模块解决的是另一个老大难:单张图像只能看到物体的一面,背面和侧面常常是“想象空间”。Home3D 不直接瞎补一张大纹理图,而是先从多个规范视角预测 albedo。Albedo 可以理解为“去掉光照后的固有颜色”,也就是木头本来的木头色、布料本来的布料色,而不是照片里被灯光照得发黄发亮的颜色。这样做的核心好处是,模型先学会“物体本来长什么样”,再去处理补全和映射,避免把阴影、反光也当成材质本身。
图4:纹理生成框架概览
图4:纹理生成框架概览。系统先预测多视角 albedo,再把结果重投影到网格表面,最后补全被遮挡的区域。
图像编码公式
这条公式表示输入图像 I 会被图像编码器提取成条件 token CI,后续几何和纹理生成都会拿它当“视觉提示”。
粗阶段生成公式
粗阶段先从高斯噪声 ZT 和图像条件 CI 里生成一个粗糙的几何潜变量 Ẑc。这里的逻辑很像先画草图,不追求细节,先把轮廓站住。
粗几何先验公式
粗几何会被解码、体素化,再经过 RoPE 位置编码形成空间先验 Sc。RoPE 是 Rotary Position Embedding,中文可理解为旋转位置编码,这里用来给空间结构补上位置信息。
细化阶段生成公式
细化阶段再结合图像条件和粗几何先验,生成更精细的潜变量 Ẑr。这一步专门负责把“像个椅子”修成“像一把具体的椅子”。
纹理训练也不是简单地喂图。论文把扩散损失、视角一致性、图像重建和梯度约束混在一起,让模型既要会生成,又不能在不同视角上“前后不一”。这点很现实:家具纹理最怕背面和正面不是同一种布,或者同一块木纹在不同视角里突然换方向,设计师一眼就能看穿。
这部分最让人点头的是,它没有把“纹理生成”和“材质识别”混成一锅粥,而是先把固有外观尽量稳定地恢复出来,再交给后面的材质检索去补物理属性。路线清楚,工程上也更容易调。

一键拆解家具:让设计师告别手动分割的材质感知部件生成

如果只生成一个完整网格,家具编辑就会很尴尬。设计师想换个沙发面料,结果必须先手工切分几何;想把木扶手换成金属,结果还得找边界、抠 UV、重新烘焙。Home3D 直接把这一步前移:先做材质感知分割,再做 PBR 材质检索。换句话说,它不是让人对着整块石头雕花,而是先帮人把石头切成可编辑的零件。
图5:材质感知分割与检索框架
图5:材质感知分割与检索框架。前半段用 MatWeaver 把 3D 网格拆成语义一致的材质区域,后半段用多模态检索为每个区域找到合适的 PBR 材质。
这里的 MatWeaver 思路很聪明:它把 3D 部件分割转成视频分割问题。先从多个视角渲染家具,再借助 SAM2 这类视频分割模型做跨帧追踪,最后把 2D 分割结果投回 UV 空间,通过投票确定每个面片属于哪个材质区域。这样做的好处是,分割不再只依赖单视角猜测,而是利用多视角一致性减少漏分和错分。
更关键的是,它分的不是“腿、背、扶手”这种功能部件,而是“布料、木头、金属、玻璃、塑料”这种材质部件。这个选择很贴室内设计真实需求,因为设计师最常改的往往不是结构,而是表面材料。一个沙发能不能换皮、一个柜门能不能改木纹,远比“这是不是叫靠背”更重要。
纹理训练损失公式
纹理分支的训练目标由扩散损失、视角一致性、图像重建和梯度约束组成。简单说,就是既要会生成,又要在不同视角下保持一致,还要保住边缘和细节。
部件VAE损失公式
部件生成这边则把重建损失、抑制损失和 KL 正则放在一起,目标是让不同部件既能分得开,又不会长出一堆无关的“多余肉”。
图6:材质感知部件生成架构
图6:材质感知部件生成架构。PartVAE 负责学习多头部件 SDF 的紧凑潜空间,PartDiT 负责在图像条件和整体几何条件下生成部件潜变量。
这部分还有一个很工程化的优点:一次生成多个部件。很多旧方案是一个部件一个部件地生成,部件一多,推理时间和复杂度就跟着膨胀。Home3D 用多头 SDF 一次性输出多个部件,至少在“生成效率”这件事上,没把自己活活做成手工流水线。
图9:材质感知部件分解对比
图9:与闭源图生3D系统的材质感知部件分解对比。Home3D 1.0 能把家具拆成材质一致、可编辑的部件,而对比系统往往只给出一个完整贴图表面。
图10:材质替换效果
图10:材质替换效果。经过部件分解后,不同区域可以分别替换成布料、木头、金属或塑料外观,这才是真正对设计师有用的“可编辑”。

硬核对比:CD/EMD/CLIP-I全面领先,效果完胜现有方案

实验部分最值得看的,不是某个单项分数,而是它把几何、外观、部件三块都单独拿出来比。这样做比“随手搞个总分”靠谱得多,因为家具 3D 资产的失败,往往不是一个维度崩,而是某个关键维度一崩就没法用。
表1:主实验结果
表1:家具基准上的主实验结果。几何用 CD、EMD 和 F1@0.01 评估,外观用固定视角下的 PBR 渲染计算 CLIP-I 和 LPIPS,箭头表示越优越好或越低越好。
从表1能看出,Home3D 1.0 在几何指标上是明显占优的,尤其是在更关注形状对齐和表面完整性的指标上,优势比较实在。这说明它的粗到细几何建模不是摆设,确实把家具这种“薄、直、规整、还带细节”的对象处理得更稳。对家具来说,几何不稳不是小瑕疵,而是直接影响可用性的硬伤。
外观指标上,它也不是只会“看起来不错”,而是能在 CLIP-I 这类语义相似度指标上保持竞争力,同时把 LPIPS 压下来。CLIP-I 衡量的是生成结果和参考图在语义上的接近程度,LPIPS 则更偏向感知差异,越低越好。换句话说,它既没把椅子生成成“另一个物种”,也没有把表面糊成一片。对于一张输入图生成完整家具资产,这已经很接近产品化要求了。
图7:几何定性对比
图7:几何定性对比。和基线方法相比,Home3D 1.0 的网格更完整,薄部件和局部结构保留得更好。
图8:PBR外观定性对比
图8:PBR 外观定性对比。Home3D 1.0 的材质反应更稳定,金属、木纹、布料等属性更接近真实渲染效果。
更重要的是,它的优势不是靠某一个模块硬撑出来的。几何稳,纹理才有地方落;纹理稳,材质检索才不会把错误放大;部件分得开,设计师才真的能改。这个链条一旦打通,3D 生成就不再只是“出图”,而是“出资产”。

从淘宝到一整个虚拟客厅:Home3D的电商与设计未来

Home3D 1.0 的定位很明确:不是做一个“科研 demo”,而是面向电商和室内设计的资产生产系统。这个定位决定了它的很多取舍都很务实。比如,不执着于把所有 PBR 通道都从头生成,而是通过材质库检索和烘焙来提高稳定性;再比如,不把部件分割理解成纯学术语义任务,而是直接对接材料替换和场景编辑。
这类系统真正有价值的地方,在于它把“生成模型”往“生产系统”推了一步。对电商来说,它能把商品图快速变成可展示、可旋转、可沉浸浏览的 3D 资产;对室内设计来说,它能让设计师更快把单品放进虚拟客厅里试搭配,而不是花大量时间做手工建模和贴图。尤其在家居这种 SKU 多、风格多、材质多的场景里,自动化的边际收益非常高。
当然,它离“全自动、零人工、任意图片都能完美还原”还差得远。单图输入天然会带来遮挡信息缺失,复杂反光材质也不是一张照片就能彻底看透。论文自己也承认,系统是分模块评估的,说明当前更像是一个强工程原型,而不是已经闭眼可商用的终局方案。但这并不减分,反而说明作者对边界很清醒:先把能稳定落地的部分做扎实,再谈更大规模的泛化。
如果继续往前看,Home3D 这条路线很可能会往两边延伸:一边是更强的多视图和视频输入,让单图约束更少;另一边是更细的材质与结构编辑,让“换布料、换木纹、换金属边框”变成真正可交互的设计操作。对于家居行业来说,这种能力不是锦上添花,而是能直接影响内容生产效率和展示转化率的东西。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的不是“生成一个大概像家具的 3D 模型”,而是“如何从单张照片生成可编辑、可替换材质、可用于室内设计和电商展示的家具资产”。也就是说,目标从一开始就不是好看,而是好用。

PBR、albedo、SDF 这些词分别是什么意思?PBR 是基于物理的渲染,强调材质在光照下的真实反应;albedo 是去掉光照影响后的固有颜色;SDF 是有符号距离场,用来连续表示物体表面和内部外部关系。把这三样结合起来,才能同时兼顾形状、颜色和真实材质表现。

为什么要把家具拆成材质部件,而不是普通功能部件?因为室内设计里最常见的编辑动作不是“把椅子拆成腿和靠背”,而是“把这块布换成另一种布,把这块木头换成金属”。材质部件比功能部件更贴近真实工作流,能直接服务材质替换和局部修改。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 不是单点炫技,而是把几何、纹理、材质检索、部件生成串成一条可落地链路,创新更偏系统级整合。

实验合理度:★★★★☆ 几何、外观、部件分开评估,指标也比较对口,至少没有拿一个总分糊弄人。

学术研究价值:★★★★☆ 对“图生3D”从通用对象走向家具资产生产,方向很明确,能给后续工作提供很好的工程范式。

稳定性:★★★☆☆ 模块化设计提升了稳定性,但单图输入、复杂材质和遮挡问题仍然是硬边界。

适应性以及泛化能力:★★★☆☆ 对家具和室内设计场景很强,但离任意类别、任意材质的通用资产生成还差一段路。

硬件需求及成本:★★★☆☆ 生成链路不短,尤其是多模块串联和材质检索,推理成本不会太轻。

复现难度:★★☆☆☆ 论文把系统拆得很细,但这类工业级流程往往数据、工具链和工程细节都不少,复现门槛不低。

产品化成熟度:★★★☆☆ 在电商展示和设计辅助上已经有明确方向,但要大规模商用,还需要更强鲁棒性和更低成本。

可能的问题:单图信息不足仍是天花板,复杂反光/遮挡材质容易失真,系统更像强工程原型而非终局方案。


主要参考文献

[1] Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design. arXiv, 2026.
[2] 论文中引用的 ObjaverseXL、3D-FRONT、LATTICE、Seed3d 2.0、SAM2、RoMA、Qwen3-VL、DINOv2 等相关工作。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
室内设计、3D资产、图像生成、材质编辑这些方向的同学,进群聊 Home3D 这种“从图到货”的活儿,最对味。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。