← 返回 PaperDaily 视觉与图像

只需3分钟!台交大新作JanusMesh:零样本生成3D视觉错觉,一个模型秒变两种物体

3D视觉错觉生成一直是个「看着悬乎、做着更悬」的课题。以往的方法要么慢得像蜗牛(40分钟一个),要么生成的东西满是拼接缝和色彩过曝。台湾阳明交通大学这次祭出的JanusMesh,直接把时间压缩到3-5分钟,而且不需要针对每个形状做优化训练,真正做到了零样本!更关键的是,它生成的模型从各个角度看都完整无漏,只在特定视角才「变戏法」,效果相当惊艳。对于做3D内容

只需3分钟!台交大新作JanusMesh:零样本生成3D视觉错觉,一个模型秒变两种物体
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
3D视觉错觉生成一直是个「看着悬乎、做着更悬」的课题。以往的方法要么慢得像蜗牛(40分钟一个),要么生成的东西满是拼接缝和色彩过曝。台湾阳明交通大学这次祭出的JanusMesh,直接把时间压缩到3-5分钟,而且不需要针对每个形状做优化训练,真正做到了零样本!更关键的是,它生成的模型从各个角度看都完整无漏,只在特定视角才「变戏法」,效果相当惊艳。对于做3D内容创作或数字艺术的小伙伴,这绝对是个宝藏工具。


原论文信息如下:
论文标题:
JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising
发表日期:
2026年06月
发表单位:
台湾阳明交通大学 (National Yang Ming Chiao Tung University)
原文链接:
https://arxiv.org/pdf/2606.20563v1.pdf
项目链接:
https://siang1105.github.io/JanusMesh.github.io/

3D错觉生成的新突破:从2D到3D的零样本飞跃

你见过那种"一物两面"的魔术吗?比如一个雕像,正面看是孔雀,转到背面却变成了菠萝。这不是特效,而是实实在在的3D模型——3D视觉错觉,一个让物体从不同视角呈现出完全不同语义的迷人课题。
以前想做这事,要么用基于分数蒸馏采样(SDS)的方法,慢得像蜗牛——生成一个形状要40分钟,还颜色过饱和;要么简单粗暴地把两个物体拼在一起,结果拼接缝明显,背面语义还泄露到正面,看着就像"穿帮"了。
台湾阳明交通大学的研究团队这次祭出的JanusMesh,直接把生成时间压缩到3-5分钟,而且不需要针对每个形状做优化训练——真正的零样本(Zero-Shot)。更关键的是,它生成的模型从各个角度看都是一个完整无缝的网格,只在特定视角才变出"戏法",效果相当惊艳。插图
来看个直观的例子:输入两个文字提示"孔雀"和"菠萝",JanusMesh在不到5分钟内就生成一个单一3D网格。从随意角度看,它是一团抽象几何;但只要转到预设视角θ1,它"变"成一只孔雀;转到θ2,它又"变"成一个菠萝。完美!
图1:零样本3D视觉错觉生成。给定两个不同的文本提示,本方法创建一个单一的3D网格,承载双重语义视觉错觉。从任意视角看,生成形状不可辨认,但当从特定相机角度(视角θ1和视角θ2)观察时,它完美地揭示出两个目标语义(例如孔雀和菠萝)。本框架高效地实现这种复杂的3D错觉,无需对每个形状进行优化。
图1:零样本3D视觉错觉生成。给定两个不同的文本提示,本方法创建一个单一的3D网格,承载双重语义视觉错觉。从任意视角看,生成形状不可辨认,但当从特定相机角度(视角θ1和视角θ2)观察时,它完美地揭示出两个目标语义(例如孔雀和菠萝)。本框架高效地实现这种复杂的3D错觉,无需对每个形状进行优化。
对比一下现有方法(图2):SDS方法颜色过饱和,直接拼接法有难看的几何接缝和语义泄露。JanusMesh生成的是无缝、双重语义一致的3D网格,而且不需要训练,效率碾压。
图2:3D视觉错觉生成方法对比。(a)基于SDS的方法遭受严重的过饱和和慢速优化。(b)直接拼接暴露出不自然的几何缝隙和目标视角的语义泄露(红色箭头)。(c)本方法创建无缝、双重语义一致的3D网格。与之前方法不同,本方法不需要训练,在3-5分钟内生成高质量的3D视觉错觉,同时完全防止两种语义之间的几何干扰。
图2:3D视觉错觉生成方法对比。(a)基于SDS的方法遭受严重的过饱和和慢速优化。(b)直接拼接暴露出不自然的几何缝隙和目标视角的语义泄露(红色箭头)。(c)本方法创建无缝、双重语义一致的3D网格。与之前方法不同,本方法不需要训练,在3-5分钟内生成高质量的3D视觉错觉,同时完全防止两种语义之间的几何干扰。

跨空间双分支去噪:无缝几何融合的秘密武器

JanusMesh的核心在于一个巧妙的两阶段流水线。第一阶段负责几何生成,第二阶段负责纹理合成。先看几何部分,它有一个响亮的名字:跨空间双分支去噪(Cross-Space Dual-Branch Denoising)
这个想法的源头可以从2D图像错觉说起。在2D中,Visual Anagrams等零样本方法通过在不同视角的噪声预测之间取平均,生成多解读图像。但直接扩展到3D体素空间行不通——因为3D潜在变量的空间变换会破坏分布。JanusMesh借鉴了LookingGlass的思路:在每个去噪步骤中,将潜在变量解码到体素空间(voxel space),在体素空间完成融合,再编码回去。这就是"跨空间"的由来。
图3:流水线概览。(a)第一阶段采用双分支去噪。在每个步骤中,潜在变量被解码到体素空间,进行旋转对齐,通过SDF融合(图4)合并,然后重新编码以继续去噪,生成一个统一的三维网格。(b)第二阶段对融合后的网格进行视图条件纹理合成。通过Stable Diffusion预测估计的干净图像,从视角θ1和θ2反投影,并通过网格纹理聚合迭代聚合,生成一个单一物体,在每个目标视角呈现不同的语义。
图3:流水线概览。(a)第一阶段采用双分支去噪。在每个步骤中,潜在变量被解码到体素空间,进行旋转对齐,通过SDF融合(图4)合并,然后重新编码以继续去噪,生成一个统一的三维网格。(b)第二阶段对融合后的网格进行视图条件纹理合成。通过Stable Diffusion预测估计的干净图像,从视角θ1和θ2反投影,并通过网格纹理聚合迭代聚合,生成一个单一物体,在每个目标视角呈现不同的语义。
具体流程:在TRELLIS(一个基于修正流(Rectified Flow)的3D生成模型)的双分支去噪中,从共享的初始噪声开始,两个分支分别根据提示y1和y2独立去噪。在每个时间步t,模型预测出两个"干净"的潜在变量,然后通过稀疏结构解码器解码成体素表示v1和v2。此时需要融合它们,但直接对二值体素取平均会丢失几何连续性。于是乎,SDF融合(SDF Blending)登场了。
先将每个体素网格转换为有符号距离场(Signed Distance Field, SDF)——就是每个点到物体表面的带符号距离,内部为负外部为正。然后对两个SDF取逐元素平均值,再通过阈值τ二值化,得到一个平滑的融合体素。图4展示了这个过程:一个圆和一个三角形的SDF平均后,自然产生一个介于两者之间的中间轮廓,完美解决了几何不连续的问题。
图4:SDF融合。(a)给定两个旋转对齐的体素,计算它们的SDF,逐元素取平均,用阈值τ二值化得到融合后的体素。(b)二维示例:对圆(A)和三角形(B)的SDF取平均,产生一个光滑的中间轮廓,几何上位于两者之间。
图4:SDF融合。(a)给定两个旋转对齐的体素,计算它们的SDF,逐元素取平均,用阈值τ二值化得到融合后的体素。(b)二维示例:对圆(A)和三角形(B)的SDF取平均,产生一个光滑的中间轮廓,几何上位于两者之间。
但融合之前,两个物体必须对齐。不同物体在标准姿态下有默认朝向,直接按0°和180°拼可能错位。为此,JanusMesh设计了一个CLIP引导的姿态搜索(CLIP-guided Orientation Search)(图6)。先为第一个物体生成单语义体素,渲染4个候选视角,用CLIP文本-图像相似度选出最能代表y1的视图作为锚点视图I1。然后对第二个物体在三维空间采样28种旋转组合(90°间隔),计算每种的渲染图与I1的CLIP图像-图像相似度,选最高的作为融合朝向θ2。这样自动将两个物体的最优轮廓对齐,提高融合质量。
图6:CLIP引导的姿态搜索。锚点视图选择:从4个正交渲染中通过CLIP文本-图像相似度(例如“菠萝”在90°)找出v1的最佳代表视图I1。跨物体匹配:评估v2的28种3D旋转,选出使CLIP图像-图像相似度最大化的角度θ2,从而在SDF融合前最优地对齐轮廓。
图6:CLIP引导的姿态搜索。锚点视图选择:从4个正交渲染中通过CLIP文本-图像相似度(例如"菠萝"在90°)找出v1的最佳代表视图I1。跨物体匹配:评估v2的28种3D旋转,选出使CLIP图像-图像相似度最大化的角度θ2,从而在SDF融合前最优地对齐轮廓。

视图条件纹理合成:为单一网格赋予双重视觉灵魂

几何融合完成,得到了一个同时包含两种物体形状的网格——但此时它还是"素颜"的,纹理取决于你怎么上色。直接拿TRELLIS自带的纹理生成会失败,因为融合后的几何是不自然的。JanusMesh在第二阶段专门设计了视图条件纹理合成(View-Conditioned Texture Synthesis)
简单说,就是用深度条件ControlNet(基于Stable Diffusion)分别从视角θ1和θ2渲染深度图,根据对应提示y1和y2预测纹理。预测出的"干净图像"通过反投影映射到3D表面上。然后,通过网格纹理聚合(Mesh Texture Aggregation)将多个视角的贡献用余弦加权(基于表面法线)融合在一起,得到高质量、无缝的纹理。
那怎么决定哪个视角用哪个纹理呢?答案是视角依赖的纹理选择:假设θ1=0°,那么270°-90°的视角采用y1的纹理估计,其余角度(90°-270°)采用y2的纹理。虽然用的是硬阈值,但由于余弦加权混合在边界处自然平滑过渡,不会出现可见的接缝。
此外,为了解决纯随机噪声起点缺乏空间结构约束的问题,JanusMesh还提出了两种噪声引导(Noise Guidance)策略:噪声混合引导(Noise Blending Guidance)和空间控制引导(Space Control Guidance)(图5)。前者将先验解码体素与纯噪声加权混合,注入温和的空间先验;后者在去噪的前t0步使用强结构约束(从先验开始插值)。根据物体对的几何兼容性,可以选择不用的引导强度。
图5:噪声引导。给定两个提示y1和y2,独立生成两个单语义体素v1和v2,分别放在θ1和θ2后拼接成v_guide,通过稀疏结构编码器编码得到z_guide。噪声混合引导:将z_guide与纯噪声按α·z_guide+(1-α)·z_noise混合,注入温和的空间先验。空间控制引导:在时间步t0在z_guide和噪声之间插值,为几何困难对提供更强的结构约束。
图5:噪声引导。给定两个提示y1和y2,独立生成两个单语义体素v1和v2,分别放在θ1和θ2后拼接成v_guide,通过稀疏结构编码器编码得到z_guide。噪声混合引导:将z_guide与纯噪声按α·z_guide+(1-α)·z_noise混合,注入温和的空间先验。空间控制引导:在时间步t0在z_guide和噪声之间插值,为几何困难对提供更强的结构约束。

实验大比拼:速度与质量的双重碾压

JanusMesh到底有多快?看表1:单个NVIDIA RTX 4090上,最快要约3分钟完成,即使加上CLIP姿态搜索也只要5分钟。而基于SDS的方法需要~40分钟,差距一个数量级!
表1:在单张NVIDIA RTX 4090上,各阶段和每种情况下的运行时间分解。
表1:在单张NVIDIA RTX 4090上,各阶段和每种情况下的运行时间分解。
除了速度,还有一系列定量指标来验证效果。论文设计了六大指标:CLIP相似度、GPT准确率、FID/KID、物体检测分数、视图条件CLIP对比度、边界接缝影响因子。在50个随机提示对上测试,JanusMesh在GPT准确率(84% vs 76% vs 70%)、FID(最低)、物体检测(平均单个物体率最高)上全面领先。特别地,直接拼接虽然CLIP分数高,但那是因为它"作弊"——直接保留单视角外观,而不是真正的错觉质量。
定性对比更是直观:图9展示了与Shape From Semantics、Direct Concatenation、TRELLIS、DreamBeast等方法的对比——JanusMesh的几何连贯、纹理真实、语义清晰,没有过饱和也没有接缝。
图9:与基线方法的定性对比。从左到右:视角1、融合网格、视角2。(a)Shape From Semantics [40]遭受过饱和和几何泄露(例如“鹳”/“葡萄”)。(b)直接拼接暴露出不自然的接缝和反面几何。(c)本方法生成单个连贯网格,具有清晰的视角依赖语义且无泄露。(d)TRELLIS [73]未能生成视角依赖语义,坍塌成无法反映任一目标的通用形状。(e)DreamBeast [42]生成奇幻混合生物,在每个视角混合语义而非分离,未实现预期错觉效果。
图9:与基线方法的定性对比。从左到右:视角1、融合网格、视角2。(a)Shape From Semantics [40]遭受过饱和和几何泄露(例如"鹳"/"葡萄")。(b)直接拼接暴露出不自然的接缝和反面几何。(c)本方法生成单个连贯网格,具有清晰的视角依赖语义且无泄露。(d)TRELLIS [73]未能生成视角依赖语义,坍塌成无法反映任一目标的通用形状。(e)DreamBeast [42]生成奇幻混合生物,在每个视角混合语义而非分离,未实现预期错觉效果。
用户研究也验证了感知质量:78.5%的参与者认为JanusMesh生成的语义"清晰可辨"(评分3),71%的参与者更偏好JanusMesh,91%认为CLIP引导的朝向比固定0°/180°产生更自然的错觉(图11)。
图11:用户研究。(左)语义可辨识度:78.5%的参与者将我们的结果评为清晰可辨(评分3)。(中)方法偏好:71%的参与者偏好我们的方法,优于Shape From Semantics [40](16%)和直接拼接(13%)。(右)朝向策略:91%的参与者发现CLIP引导的朝向比固定0°/180°角度产生更自然的错觉。
图11:用户研究。(左)语义可辨识度:78.5%的参与者将我们的结果评为清晰可辨(评分3)。(中)方法偏好:71%的参与者偏好我们的方法,优于Shape From Semantics [40](16%)和直接拼接(13%)。(右)朝向策略:91%的参与者发现CLIP引导的朝向比固定0°/180°角度产生更自然的错觉。

从双视角到三视角:几何冲突的优雅解法

JanusMesh还能自然地扩展到三目标错觉!思路很简单:在第一阶段增加第三个去噪分支,将三个目标视角固定为0°、120°、240°(均匀覆盖360°)。每个步骤对三个预测体素进行SDF融合,然后分别逆旋转并重新编码。因为三个几何体冲突更强,噪声引导是必须的,而且空间控制引导的t0要增加到20步(共25步)以提供更强约束。
图7:扩展到三物体3D错觉。本框架通过增加第三个去噪分支扩展到三个语义(例如“葡萄”、“菠萝”、“竹子”),旋转角度固定为0°、120°、240°以均匀覆盖360°。噪声引导将三个分支导向各自目标,确保每个语义在目标视角清晰呈现。
图7:扩展到三物体3D错觉。本框架通过增加第三个去噪分支扩展到三个语义(例如"葡萄"、"菠萝"、"竹子"),旋转角度固定为0°、120°、240°以均匀覆盖360°。噪声引导将三个分支导向各自目标,确保每个语义在目标视角清晰呈现。
图15展示了三目标生成的结果:一个网格在0°显示葡萄,120°显示菠萝,240°显示竹子,每个视角都语义清晰,几何完整。这种优雅的扩展性意味着JanusMesh可以轻松应对更复杂的错觉需求。
图15:三物体3D错觉生成的定性结果。每一行显示融合网格和三个目标视角渲染。本方法成功生成单个连贯网格,分别在0°、120°和240°呈现三种不同的语义。
图15:三物体3D错觉生成的定性结果。每一行显示融合网格和三个目标视角渲染。本方法成功生成单个连贯网格,分别在0°、120°和240°呈现三种不同的语义。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决什么问题?现有3D视觉错觉生成方法要么慢(SDS方法~40分钟)、要么几何不连贯(直接拼接)、要么颜色过饱和。JanusMesh提出零样本、无需训练的两阶段框架,在3-5分钟内生成高质量、双重语义的3D网格,且几何完整、纹理真实、语义可辨。

什么是“跨空间去噪”?为什么需要跨空间?“跨空间”指在每个去噪步骤中,将3D潜在变量解码到体素空间进行几何操作(SDF融合、旋转对齐),再编码回潜在空间继续去噪。因为直接在潜在空间做空间变换会破坏分布,而体素空间是离散可操作的。灵感来自LookingGlass [5],JanusMesh将其成功用于3D多重语义融合。

JanusMesh的缺点是什么?局限包括:(1) CLIP姿态搜索只用了90°间隔采样,可能错过最优朝向;(2) 三目标错觉中固定角度(120°)可能不适用于所有物体组合;(3) 对于几何高度复杂或需要精细纹理的物体,纹理合成可能存在模糊;(4) 生成质量受限于预训练的TRELLIS和Stable Diffusion。不过作为零样本方法,这些都可以通过后续改进来解决。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★将跨空间双分支去噪与SDF融合结合,在零样本场景下实现3D视觉错觉,首次将2D illusion的零样本思路扩展到原生3D体素空间,同时提出CLIP引导姿态搜索,创新性很高。

实验合理度:★★★✰✰对比了4种基线方法(SDS、拼接、TRELLIS、DreamBeast),覆盖全面。但缺少与最新NeRF方法的对比(如Illusion3D),且CLIP分数被Direct Concatenation“作弊”反超,虽解释了原因,但仍需更精细的指标来区分真实错觉质量。

学术研究价值:★★★★★提出了一种新范式——以零样本方式从2D illusion跨界到3D illusion,且代码和模型开源。对后续3D可控生成、多语义融合研究有重要启发。SDF融合+跨空间去噪的思路也可用于其他3D任务。

稳定性:★★★✰✰在论文展示的示例上效果稳定,但用户自行测试时,对于几何差异极大的物体对,可能仍需要调节噪声引导参数。CLIP姿态搜索有一定随机性,可能选出次优角度。整体属于“demonstration”级,要成为产品级工具还需更多鲁棒性改进。

适应性以及泛化能力:★★★✰✰可以处理多种物体类型(鸟、哺乳动物、植物、人造物等),并能扩展到三物体。但依赖TRELLIS和Stable Diffusion的预训练分布,对于罕见的、结构性特别复杂的物体可能效果下降。目标视角数量固定,未测试非整数倍视角分配。

硬件需求及成本:★★★★✰单张RTX 4090即可运行(3-5分钟),训练不需要额外成本,推理开销中等。相比其他3D生成方法(如DreamFusion需要数小时),性价比极高。但消费级用户需要具备一定Python和CUDA环境配置能力。

复现难度:★★★★✰论文提供了项目页面和代码,基于TRELLIS和Stable Diffusion等开源模型,详细介绍了参数设置。有一定3D视觉基础的开发者可以较顺利地复现。但需要理解TRELLIS的内部结构,以及Rectified Flow的训练和采样逻辑。

产品化成熟度:★★✰✰✰目前仍处于学术研究阶段,需要一定的技术门槛。直接作为面向设计师的傻瓜式工具还差一点,如输入两个文本就自动出模型的界面。不过作为后端引擎具有很强的潜力,可以和前端工具结合快速产品化。

可能的问题:主要局限在于几何融合时对物体姿态依赖CLIP搜索,可能不稳定;三目标情况下纹理合成仍可能产生不自然混合;缺少与最新NeRF/GS方法的直接对比;用户研究样本量(50人)偏小,统计显著性有限。另外,对于语义差距特别大的物体对(如“汽车”和“铅笔”),效果可能不如语义相近的对。

参考文献

[1] Geng et al., “Shape From Semantics: 3D Visual Illusion Generation via Score Distillation Sampling”, SIGGRAPH 2024.
[2] Xiang et al., “TRELLIS: Structured 3D Latents for Scalable and Versatile 3D Generation”, arXiv 2024.
[3] Gokhale et al., “Visual Anagrams: Generating Multi-Interpretation Images with Diffusion Models”, ICLR 2025.
[4] Liu et al., “DreamBeast: Distilling 3D Fantastical Creatures with Part-Level Semantic Control”, 2024.
[5] Tu et al., “LookingGlass: Image-based Anamorphic Illusion Generation with Diffusion Models”, 2024.
[6] Li et al., “SpaceControl: Sketching Spatial Relationships in 3D Scenes”, ECCV 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。

『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

✨ 想要第一时间获取更多像 JanusMesh 这样前沿又有趣的 3D 视觉研究资讯和代码资源吗?快来星球与龙哥和几千名小伙伴一起交流吧!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。