← 返回 PaperDaily 视觉与图像

同济大学提出RealCAD:拍照秒变可编辑CAD模型,真实域参数精度大涨14.7%!

今天这篇来自同济大学的RealCAD,一口气揭了图像转CAD领域两个老底:合成图与真实照片之间的"照骗"差距,以及DeepCAD数据表示里藏着的"刷分捷径"。论文不仅把问题讲透了,还给出了从表示、图像到特征的三层解法,真实域参数精度直接拉升14.73个百分点,值得一读。

同济大学提出RealCAD:拍照秒变可编辑CAD模型,真实域参数精度大涨14.7%!

paperdaily_reaction_gif


原论文信息如下:
论文标题:
RealCAD: Towards Real-World Image-to-CAD Reconstruction under Domain Shift and Parameter Bias
发表日期: 2026年08月
发表单位: 同济大学
原文链接: https://arxiv.org/pdf/2608.30617v1.pdf


如果你觉得"给一张照片,让AI输出一个能编辑、能改尺寸、能直接送工厂加工的CAD模型"这件事听起来很酷,那今天这篇论文绝对是你的菜。

但先别急着兴奋。这篇文章的开局,其实是先泼了两盆冷水——

第一盆冷水:目前绝大多数图像转CAD模型,都是在合成渲染图上训练的。合成图是什么?是计算机用OpenCASCADE这类几何内核"画"出来的标准件图片,背景干净、材质均匀、光照完美。可真实世界呢?3D打印件表面有层纹、有反光、有阴影,光照角度五花八门,背景更是乱七八糟。模型在合成图上考了98分,一到真实照片上可能直接不及格。这种"模拟到现实"的鸿沟,在机器人领域叫Sim2Real gap,在图像转CAD任务里,同样致命。

第二盆冷水更隐蔽:研究者发现,被广泛使用的DeepCAD数据集,其参数表示方式存在严重的"偏置"问题。什么意思呢?就是数据里某些参数值出现的频率高得离谱,比如坐标参数x和y,光128、176、223这三个值就占了61.62%的样本;半径参数47和48两个值加起来占了55.86%。这意味着什么呢?这意味着一个"偷懒"的模型,根本不需要认真看图片里的几何形状,只需要疯狂预测这几个高频出现的数值,就能拿到看起来还不错的参数准确率。

说白了,你以为是AI在"看懂"几何,实际上它可能只是在"背答案"。

这就是今天要解读的论文——来自同济大学的RealCAD:Towards Real-World Image-to-CAD Reconstruction under Domain Shift and Parameter Bias。这篇论文的牛X之处在于,它没有回避这两个问题,而是正面硬刚,给出了从数据表示、图像翻译到特征对齐的一整套系统性解决方案。

一、CAD重建的"照骗"困境:合成与真实的鸿沟

先聊第一个问题:域偏移。

所谓图像到CAD重建,就是从一张或几张图像中,恢复出对应的参数化CAD模型——不是普通的三维网格,而是带有完整建模历史、可编辑、可修改、可重新参数化的CAD命令序列。想象一下,你拍了一张机械零件的照片,AI能直接告诉你:这个零件是先画了一个圆,然后拉伸了多少毫米,中间又做了几次布尔运算……有了这套命令序列,工程师就能直接在SolidWorks、AutoCAD里对模型进行编辑和二次开发。

这显然比生成一堆三角网格要实用得多。

然而,现实很骨感。由于真实世界图像和CAD命令序列的配对数据非常昂贵、难以大规模采集,现有方法基本都采用"合成渲染图+自动标注"的路线:从已有的CAD模型库出发,用OpenCASCADE等几何内核渲染出图像,然后拿这些合成图去训练神经网络。

问题是,合成图和真实照片之间存在着巨大的外观差异。合成渲染图里的物体,材质是均匀的、光照是理想的、背景是干净的;而真实照片里的3D打印件,表面有层纹、有污渍、有环境反光,光照可能有阴影,背景可能有杂物。这些外观层面的差异,就是所谓的"域偏移"。

OpenRealCAD:首个真实图像CAD重建基准


图1:图像到CAD重建中的关键挑战。(a) 域偏移:在合成渲染图上训练的模型,对合成输入重建准确,但在真实世界图像(例如3D打印CAD模型)上性能大幅下降。(b) 参数偏置:DeepCAD表示产生高度集中的几何参数分布,鼓励模型依赖数据集特定的统计捷径。

从图1(a)可以看得非常清楚:同一个模型,左边是合成渲染图,右边是真实照片,两者的外观差异肉眼可见。模型在合成图上训练,遇到真实照片这种"陌生"输入,性能断崖式下跌。

之前也有工作尝试解决这个问题,比如CADCrafter在训练中用了深度图和法线图作为几何条件,在一定程度上提升了模型对真实图像的泛化能力。但其真实图像评测集没有公开,而且模型主要还是靠合成数据训练,缺少针对性的Sim2Real适配机制。换句话说,问题被看到了,但还没有被系统性地解决。

二、参数偏置:被忽视的"捷径学习"陷阱

如果说域偏移是摆在全行业面前的"明敌",那参数偏置就是藏在数据集内部的"内鬼"。

DeepCAD是目前序列化CAD建模最常用的基准和表示方法。它将一个CAD模型表示为一串命令序列,每条命令用一个17维向量表示:v = [Command, x, y, α, f, r, θ, φ, γ, px, py, pz, s, e1, e2, b, u]。其中第一个维度是命令类型(线段、圆弧、圆、拉伸,以及特殊标记⟨SOL⟩和⟨EOS⟩),其余维度是几何和操作参数。


(a) CAD模型 (a) 原始DeepCAD命令序列编码


(c) 修改后的CAD命令序列编码

图2:DeepCAD参数表示的修订及其对参数分布的影响:多个参数集中在极少数有效值上(例如,大多数x和y集中在128、176和223三个特定值上)。

问题出在DeepCAD的"局部归一化"方案上。简单来说,DeepCAD把每一个草图-拉伸单元独立缩放到量化范围内,而缩放比例则单独存储在尺度因子s中。这样做的问题在于:在多单元模型中,对不同尺寸的子结构独立归一化,会把它们的局部极值反复映射到相似的离散值上,而真正的相对尺寸信息,大部分都被塞进了s这个单独的尺度因子里。

从图2(a)可以直观看到这个问题的严重性:在原始DeepCAD表示下,多个几何上完全不同的端点,可能被编码成完全相同的量化坐标值;而它们之间真正的尺寸差异,几乎全部要靠s来体现。结果就是,几何参数的分布高度集中,而尺度因子的分布却相对分散。

Table 1: CAD command types and their parameters.
Table 1: CAD command types and their parameters.

表1:CAD命令类型及其参数。

这种信息失衡带来的后果是双重的。第一,模型不需要真正从图像中推断几何信息,只需要记住那些高频出现的参数值,就能在参数准确率上拿到很高的分数——这是一种典型的"捷径学习"。第二,在评估时,对所有参数准确率取平均会低估s的误差,但s恰恰携带了大量几何信息,控制着整个草图-拉伸单元的尺寸。换句话说,两个参数准确率相近的模型,其真实几何保真度可能天差地别。

论文中的表2定量展示了这个问题的严重程度。

Table 2: Comparison of the original DeepCAD representation and the revised DeepCAD representation. Model denotes the accuracy of the trained reconstruction model, while Prior denotes the accuracy obtained by always predicting the most frequent valid training-set value for each parameter type. ∆ = Model − Prior measures the gain over the frequencyonly baseline. All values are reported as percentages.
Table 2: Comparison of the original DeepCAD representation and the revised DeepCAD representation. Model denotes the accuracy of the trained reconstruction model, while Prior denotes the accuracy obtained by always predicting the most frequent valid training-set value for each parameter type. ∆ = Model − Prior measures the gain over the frequencyonly baseline. All values are reported as percentages.

表2:原始DeepCAD表示与修订版DeepCAD表示的对比。模型列表示训练后的重建模型准确率,先验列表示对每个参数类型始终预测训练集中最频繁的有效值所获得的准确率。Δ = 模型 − 先验 衡量相对于仅频率基线的增益。所有数值均以百分比报告。

看第一列数据就明白了:在原始DeepCAD表示下,一个"啥也不看、只管猜最高频值"的基线模型,在线段参数上能拿到16.77%的准确率,在圆参数上能拿到26.13%,圆弧上更是高达31.31%。这意味着模型在训练中很可能大量依赖这些频率先验,而不是真正从图像中推断几何。

论文的处理方式非常干净利落:把所有草图-拉伸单元统一到同一尺度空间,将s中编码的尺度信息重新分配回各个受影响的几何参数:

p_new = 128 + (p_ori - 128) * (s / 192)

其中128是量化原点,192是原始表示中最大尺度的参考值。这个变换的几何意义很直观:相当于把每个草图-拉伸单元都放到同一个参照尺度下表达,把原始相对尺寸直接编码进几何参数中。这样,显式的尺度参数s就不再需要了,直接从命令向量中移除。

从图2(b)可以看到修订后的效果:没有任何单个值能占到坐标分布的3.5%以上,半径参数的最大频率也降到了14.6%。参数集中问题得到了大幅缓解。

三、RealCAD三管齐下:表示、图像、特征全面优化

解决了表示层面的"内鬼",接下来就要正面迎战域偏移这个"明敌"了。

RealCAD的整体思路可以概括为"三管齐下":在表示层面,用修订版DeepCAD表示,消除参数偏置;在图像层面,用几何约束的合成到真实翻译,缩小外观差异;在特征层面,用多正样本对比学习,对齐跨视角、跨域的特征表示。


图3:RealCAD中特征学习管线的概述。来自合成域和真实域的多视角图像由冻结的预训练DINOv3编码器编码,并投影到共享表示空间,其中多正样本对比学习促进同一CAD模型的跨视角和跨域一致性。

先说图像层面的翻译。RealCAD的做法是用边缘条件ControlNet来做合成到真实的图像翻译。具体来说,给定CAD模型m在视角v下的合成渲染图x_syn和对应的边缘图e,通过边缘条件ControlNet生成翻译后的图像:

x_tr = G_ctrl(x_syn, e, p; ε)

其中G_ctrl表示边缘条件ControlNet,p是文本提示,ε是扩散采样过程中的随机噪声。边缘条件的核心作用在于:强制翻译过程保留物体的轮廓和几何结构,只改变材质、纹理、光照、阴影等外观属性。这样翻译出来的图像,既具有真实照片的外观风格,又不会丢失CAD重建所需的几何信息。

再说特征层面的对比学习。对于每个CAD模型,RealCAD渲染四张固定视角的图像,用预训练的DINOv3-ViT-7B编码器提取视觉特征,再通过一个可学习的投影层映射到共享潜在空间。同一个
同一个CAD模型在不同视角、不同图像域下的特征表示,应当尽量趋于一致。这是RealCAD在特征层面做文章的核心立场。
具体来说,对于任意两个样本对(i, j),假设它们的特征经过L2归一化后得到ẑi和ẑj,那么两者之间的相似度logit定义为:sij = α·ẑiᵀẑj + b,其中α = exp(t),t和b分别是可学习的log尺度参数和偏置参数。这个参数化方式保证logit的尺度α恒为正数,让对比学习过程更稳定。如果两个样本属于同一个CAD模型,则标签yij = 1,否则yij = -1。整个多正样本对比损失L_siglip对所有有效样本对求期望。
公式:样本对相似度logit的定义,其中α=exp(t)保证尺度为正
公式中α=exp(t)的巧妙之处在于,它把可学习尺度参数t映射到正数区间,避免了训练中尺度变为负值或零导致的数值不稳定问题。
公式:多正样本对比损失Lsiglip,基于Sigmoid函数对有效样本对求和
这个损失的名字里藏着SIGLIP的基因——SIGLIP全称是Sigmoid Loss for Language Image Pre-training,是一种基于Sigmoid函数的对比学习损失。它和传统InfoNCE对比损失最大的区别在于:每个正样本对单独计算一个Sigmoid损失,天然支持一个样本拥有多个正样本。在RealCAD里,同一个CAD模型对应四个固定视角的合成渲染图、翻译图以及真实照片,所有来自同一模型的不同视角、不同域变体之间全部构成正样本对,这正是"多正样本"的含义。
特征对齐解决了"表示空间里跨域一致性"的问题,但最终还是要输出CAD命令序列。RealCAD的做法是,把每一个视觉特征表示独立送入一个Transformer解码器,逐步预测完整CAD命令序列中的每一个token。在每一个序列位置,解码器需要同时预测命令类型和对应的离散化参数,对应的重建损失定义为:
公式:重建损失Lrec,由命令类型交叉熵损失Lcmd和参数分类交叉熵损失Lpara加权组合
其中λ1和λ2是两个损失的平衡超参数。L_cmd负责命令类型分类(是画线段、圆弧、圆,还是执行拉伸操作),L_para负责所有离散化几何参数的分类(坐标、半径、旋转、平移、拉伸距离等)。最终的总训练目标把对比学习和重建任务联合起来一起优化:
公式:总训练损失L等于多正样本对比损失Lsiglip与重建损失Lrec之和
到这里,RealCAD的三层设计就串成了一条完整的链路。在表示层面,修订版DeepCAD表示消除了参数集中分布带来的"背答案"捷径;在图像层面,边缘条件ControlNet把干净规整的合成渲染图翻译成带有真实材质、纹理、光照甚至阴影效果的照片风格图像,同时用边缘图锁住几何轮廓,保证翻译过程不破坏CAD重建所需的形状信息;在特征层面,多正样本对比学习让编码器对"同一模型的不同视角、不同外观"产生高度一致的表示。训练时利用大规模合成数据加上少量真实图像适配,推理时只输入真实照片,编码器提取特征,解码器生成完整的CAD命令序列。环环相扣,缺一不可。
但有一个问题值得停下来想一想:前面说真实图像和CAD命令序列的配对数据很难采集,那RealCAD的"少量真实图像适配"到底用的是什么数据?答案是论文自己构建的OpenRealCAD基准。这也是这篇论文的另一个重要贡献。
以往图像转CAD领域有个尴尬的现实:几乎所有模型的测试都在合成渲染图上进行,偶尔有工作声称能处理真实照片,但评测集不公开、数据量小、缺乏可复现的统一协议。想要严谨地回答"模型在真实照片上到底行不行",就必须有一个带完整CAD命令序列真值的真实图像基准。
OpenRealCAD的构建思路非常"硬核":从DeepCAD数据集中随机挑选392个源模型,先用修订版DeepCAD表示重新编码它们的构造序列——这一步保证合成域和真实域共享同一套输出参数化方式,避免跨域训练和评估时出现表示不匹配。然后,论文把这些CAD模型通过3D打印制造成物理实物,在受控背景和光照条件下,从四个固定视角拍摄真实照片。这样一来,每一个物理物体都同时拥有"合成渲染图"和"真实照片"两套视觉数据,而且背后对应着完全相同的CAD命令序列真值。

图4(a):OpenRealCAD数据集中3D打印CAD模型的多视角图像示例。


图4(b):OpenRealCAD数据集中使用手机拍摄的额外3D打印模型示例。
从图4可以看出,OpenRealCAD里的真实照片和合成渲染图之间存在明显的外观差距:3D打印件的表面有层纹、有环境反光、有阴影,这些都是合成渲染难以完全模拟的。但也正因为这些照片是在受控条件下拍摄的,相机位姿、背景、遮挡被限制在较窄范围内,所以这个基准集中火力评估的是材质、纹理、光照、阴影、成像伪影等外观层面的域偏移对重建的影响,而不是一上来就挑战完全不受控的野外场景。用论文里的话说,OpenRealCAD提供了一个介于"纯合成评估"和"无约束真实环境部署"之间的过渡性评测环境。
表1:CAD命令类型及其参数说明
表1给出了命令序列中每类命令对应的参数含义:线段命令L有端点坐标x、y;圆弧命令A有端点坐标、扫掠角α和方向标志f;圆命令C有圆心坐标和半径r;拉伸命令E则包含平面旋转θ、φ、γ、平面平移p_x、p_y、p_z、尺度因子s、拉伸距离e1、e2以及布尔类型b。这套表示是整个数据集和模型训练的基础。
OpenRealCAD按照CAD实例级别以7:3的比例划分训练和测试子集。这里"实例级别"四个字很关键——它意味着同一个CAD模型的所有视角、所有域变体只能全部落在训练集或者全部落在测试集,绝不允许交叉。与此同时,所有与真实测试集模型对应的合成渲染图也被排除在训练数据之外,从源头上杜绝了实例泄漏。真实训练子集用于支持有限的真实域适配,而测试子集则用来评估模型对从未见过的物理物体的泛化能力。

实验结果:真实域大幅提升,合成域保持竞争力

实验设置方面,合成数据按照9:1划分训练集和测试集,OpenRealCAD按7:3划分。对比基线包括:DeepCAD(论文用DINOv3编码器对官方代码做了图像条件适配,用*标注)、Img2CAD和CADCrafter(这两者的官方代码不可用,论文基于已发表论文复现,用†标注;其中CADCrafter的复现去掉了DPO阶段)。所有方法使用相同的数据划分和评估协议。
评价指标一共有四个:命令准确率(Cmd.)、参数准确率(Para.)、中位数倒角距离(mCD)和无效比率(IR)。命令准确率衡量每个序列位置命令类型预测正确的比例;参数准确率衡量有效参数值预测正确的比例;中位数倒角距离衡量成功构造成形的预测模型与真值模型之间的几何差异,越小越好;无效比率则统计预测序列无法被CAD内核解析或构造成形的比例。
表3:合成域与真实域测试集上的定量对比结果
表3上半部分展示合成域测试结果。RealCAD在命令准确率72.94%、参数准确率61.35%、中位数倒角距离0.220三项指标上均为最优或接近最优,合成域性能没有因为针对真实域做了适配而大幅牺牲。下半部分展示真实域测试结果,这才是重头戏:RealCAD命令准确率达到64.85%,参数准确率达到52.03%,相比CADCrafter分别高出7.49和14.73个百分点;相比Img2CAD也分别高出3.05和8.95个百分点。这说明图像级几何约束翻译加上特征级多正样本对比学习,确实实打实地缩小了Sim2Real鸿沟。
但请注意一个细节:真实域的中位数倒角距离0.308并没有相对基线显著下降,无效比率48.72%反而明显偏高。论文对这个问题给出了非常坦诚的解释。CAD参数具有高度异质的几何敏感性:修正大量低影响力参数可以提升token级准确率,却未必能明显改变最终重建形状;而一个拓扑关键命令或几何敏感参数的失误,就可能主导整个重建误差。更关键的是,CAD执行是顺序组合式的,早期的预测错误会改变后续操作的参考系或可行域,一步错则步步错。因此,几何质量不仅仅取决于预测对了多少个参数,更取决于这些参数的语义重要性、跨命令一致性和作为一个完整程序的可执行性。
换句话说,命令级和参数级的准确率是一种"词元级"指标,而mCD和IR衡量的是"程序级"的执行结果。从词元级到程序级的这条路,RealCAD走通了一大半,但最后一公里还没有完全打通。这也是论文最值得后续跟进的地方。
论文还做了消融实验来验证两个核心模块各自的贡献:多正样本对比学习(CL)和几何约束合成到真实翻译(ST)。
表4:多正样本对比学习(CL)和几何约束合成到真实翻译(ST)对CAD重建的影响
表4的消融实验显示,单独加入几何约束翻译ST,能在真实域上带来可观的命令和参数准确率提升;单独加入多正样本对比学习CL,则增强了模型对同一模型不同视角、不同域图像特征的判别一致性;两者组合时真实域效果最佳。这验证了图像级适配和特征级对齐之间存在互补关系——一个在输入空间压缩外观差异,一个在特征空间拉近语义表示。
接下来,值得深入分析的是"修订DeepCAD表示"这件事本身到底带来了多大影响。论文设计了一个非常聪明的实验来量化这个问题:对每个参数类型,始终预测训练集中出现频率最高的有效量化值,这就是"频率先验基线"。它完全不看图像,纯靠猜。在原始DeepCAD表示下,这个先验基线在线段参数上能拿到16.77%的准确率,在圆弧参数上高达31.31%,在圆参数上也有26.13%。这意味着模型只需要疯狂输出那几个高频值,就能在参数准确率上"白嫖"大量分数,这显然不是真正的几何推理。
表2:原始DeepCAD表示与修订版DeepCAD表示的对比,模型准确率、频率先验准确率及两者差值
表2展示了修订前后的对比。修订版DeepCAD表示把线段、圆、平移参数的先验准确率分别从16.77%、26.13%、7.15%压低到3.14%、6.41%、1.64%,同时模型准确率仍然保持竞争力。这组数字的意义在于:修订之后,参数准确率里的"水分"被挤掉了,剩下的才是真正从图像中推断几何的能力。其中旋转参数和拉伸距离参数的先验分布变化不大,这是因为它们的分布并非由尺度归一化直接引起——旋转参数的集中反映的是CAD模型本身的正交方向结构,属于合理的离散先验。
图1(b):参数偏置——DeepCAD表示产生高度集中的几何参数分布,鼓励模型依赖数据集特定的统计捷径
图1(b)直观展示了这种参数偏置现象:几个关键几何参数的分布高度集中,模型很容易被少数高频值"勾着走"。
论文还在附录中详细统计了各参数族的分布偏置情况。表5展示了坐标参数x和y的分布集中程度,表6展示了半径参数r的分布,表7展示了旋转参数θ、φ、γ的分布,表8展示了平移参数p_x、p_y、p_z的分布。这些统计表从数据层面验证了:修订后的表示让参数分布更加分散,尤其是坐标和半径不再集中在少数离散值上。
表5:DeepCAD数据集中参数x和y的分布偏置统计
表5显示,原始DeepCAD表示下x和y参数的最大频率值占比极高,几个值就覆盖了绝大多数样本;修订后,没有任何单一值能占到坐标分布的3.5%以上。
表6:DeepCAD数据集中半径参数r的分布偏置统计
表6显示半径参数的最大频率从修订前的55.86%以上显著下降到14.6%,说明集中问题得到了实质性缓解。
表7:DeepCAD数据集中旋转参数θ、φ、γ的分布偏置统计
表7显示旋转参数集中在少数正交方向值上,但这种集中反映的是CAD模型本身的离散方向结构,而非归一化引入的偏置,所以修订前后变化不大。
表8:DeepCAD数据集中平移参数p_x、p_y、p_z的分布偏置统计
表8显示平移参数在剔除零值后本身相对分散,而修订后的表示进一步把先验准确率降到1.64%,对"背答案"的打击非常彻底。
这一切的核心正是那个简单的重参数化公式:
公式:修订版DeepCAD表示的重参数化,把尺度因子s吸收进几何参数
其中128是量化原点,192是原始表示中最大尺度的参考值。这个变换的几何意义非常直观:把每一个草图-拉伸单元放到同一个全局参考尺度下表达,原始单元的相对尺寸直接编码进坐标、半径等几何参数里,显式的尺度参数s自然就不需要了。这样一来,模型要想预测准确,就不得不真正去读图像里的几何结构。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?同济大学提出RealCAD框架,从表示、图像、特征三个层面系统解决图像到CAD重建的域偏移与参数偏置问题,并构建OpenRealCAD真实基准,真实域命令精度和参数精度分别大幅提升7.49%和14.73%。
这篇工作最值得看的点是什么?在真实域测试集上,RealCAD的命令准确率和参数准确率分别达到64.85%和52.03%,比CADCrafter分别提高7.49和14.73个百分点;在合成域测试集上保持竞争性表现。
这篇工作的边界或风险在哪里?优点:1) 识别并解决了DeepCAD表示中参数偏置这一被忽视的问题;2) 构建了OpenRealCAD真实图像基准数据集;3) 在图像级和特征级同时进行域适应,方法设计合理。缺点:1) 真实域mCD改善有限,IR反而升高;2) 主要优化token级准确率,未显式建模CAD语法和几何可行性;3) 数据集规模较小(392个模型)。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出RealCAD统一框架,通过重新参数化DeepCAD表示以消除参数偏置,结合几何约束的合成到真实图像翻译和多正样本对比学习,在图像级和特征级同时缩小Sim2Real域差距。

实验合理度:★★★★☆

命令准确率(Cmd.)、参数准确率(Para.)、中位Chamfer距离(mCD)、无效比率(IR)。

学术研究价值:★★★★☆

提出RealCAD统一框架,通过重新参数化DeepCAD表示以消除参数偏置,结合几何约束的合成到真实图像翻译和多正样本对比学习,在图像级和特征级同时缩小Sim2Real域差距;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练使用8块NVIDIA A100 GPU,300个epoch,batch size为128。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:;2) 构建了OpenRealCAD真实图像基准数据集;3) 在图像级和特征级同时进行域适应,方法设计合理。缺点:1) 真实域mCD改善有限,IR反而升高;2) 主要优化token级准确率,未显式建模CAD语法和几何可行性;3) 数据集规模较小(392个模型)。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球