JanusMesh到底有多快?看表1:单个NVIDIA RTX 4090上,最快要约3分钟完成,即使加上CLIP姿态搜索也只要5分钟。而基于SDS的方法需要~40分钟,差距一个数量级!表1:在单张NVIDIA RTX 4090上,各阶段和每种情况下的运行时间分解。
除了速度,还有一系列定量指标来验证效果。论文设计了六大指标:CLIP相似度、GPT准确率、FID/KID、物体检测分数、视图条件CLIP对比度、边界接缝影响因子。在50个随机提示对上测试,JanusMesh在GPT准确率(84% vs 76% vs 70%)、FID(最低)、物体检测(平均单个物体率最高)上全面领先。特别地,直接拼接虽然CLIP分数高,但那是因为它"作弊"——直接保留单视角外观,而不是真正的错觉质量。
定性对比更是直观:图9展示了与Shape From Semantics、Direct Concatenation、TRELLIS、DreamBeast等方法的对比——JanusMesh的几何连贯、纹理真实、语义清晰,没有过饱和也没有接缝。图9:与基线方法的定性对比。从左到右:视角1、融合网格、视角2。(a)Shape From Semantics [40]遭受过饱和和几何泄露(例如"鹳"/"葡萄")。(b)直接拼接暴露出不自然的接缝和反面几何。(c)本方法生成单个连贯网格,具有清晰的视角依赖语义且无泄露。(d)TRELLIS [73]未能生成视角依赖语义,坍塌成无法反映任一目标的通用形状。(e)DreamBeast [42]生成奇幻混合生物,在每个视角混合语义而非分离,未实现预期错觉效果。
用户研究也验证了感知质量:78.5%的参与者认为JanusMesh生成的语义"清晰可辨"(评分3),71%的参与者更偏好JanusMesh,91%认为CLIP引导的朝向比固定0°/180°产生更自然的错觉(图11)。图11:用户研究。(左)语义可辨识度:78.5%的参与者将我们的结果评为清晰可辨(评分3)。(中)方法偏好:71%的参与者偏好我们的方法,优于Shape From Semantics [40](16%)和直接拼接(13%)。(右)朝向策略:91%的参与者发现CLIP引导的朝向比固定0°/180°角度产生更自然的错觉。
[1] Geng et al., “Shape From Semantics: 3D Visual Illusion Generation via Score Distillation Sampling”, SIGGRAPH 2024.[2] Xiang et al., “TRELLIS: Structured 3D Latents for Scalable and Versatile 3D Generation”, arXiv 2024.[3] Gokhale et al., “Visual Anagrams: Generating Multi-Interpretation Images with Diffusion Models”, ICLR 2025.[4] Liu et al., “DreamBeast: Distilling 3D Fantastical Creatures with Part-Level Semantic Control”, 2024.[5] Tu et al., “LookingGlass: Image-based Anamorphic Illusion Generation with Diffusion Models”, 2024.[6] Li et al., “SpaceControl: Sketching Spatial Relationships in 3D Scenes”, ECCV 2024.