← 返回 PaperDaily 前沿研究

AI开始画工业零件:7篇论文拆开可编辑CAD生成链

过去两天,两篇面向真实工业设计的新论文把CAD生成推到同一个问题前:AI输出一段能运行的建模代码,究竟算不算完成了设计?答案越来越明确——能执行只是起点,零件要像、尺寸关系要合理、装配要成立,还要保留后续编辑空间。本文精选7篇代表作,梳理这条从命令序列到工业装配的完整技术链。

如果把一张产品照片交给图像生成模型,它可以画出一个“看起来像”的零件;如果把同一张照片交给CAD工程师,工程师关心的却是另一组问题:孔径是多少、草图约束是否闭合、拉伸方向是否正确、哪个面与另一零件配合、修改一个参数后设计历史能否继续工作。工业CAD不是更立体的图片,而是一份可执行、可修改、可制造的几何程序。这正是近期多模态CAD研究突然变得重要的原因。

近72小时公开的VisCAD与RealCADBench形成了一组相互咬合的新证据:前者尝试用27B多模态模型覆盖文字、工程图、渲染图和真实照片,并把零件生成延伸到装配;后者则重新定义评测,明确指出“代码跑通”不能代表工业设计正确。为看清这一步是如何发生的,文章再向前追溯DeepCAD、Text2CAD、CAD-MLLM、CADFusion与CADCrafter。它们不是简单按日期凑出的清单,而是分别占据表示、条件、反馈、真实输入、评测与装配六个关键环节。

选文逻辑:7篇论文构成从程序表示到工业装配的递进链;两篇2026年9月新作负责把已有能力推向真实工业场景。

一、先把概念说清:CAD生成为什么比“图生3D”更难

普通图生3D系统通常以网格、点云或隐式场为输出,视觉上接近目标就可能获得不错结果。但参数化CAD保存的是“怎么造出这个物体”的历史:先在哪个平面画草图,再用哪些线、圆和圆弧构成轮廓,然后拉伸、切除、倒角或做布尔运算。最终几何相同,建模历史也可能完全不同;两个外观相近的零件,孔位、壁厚和配合面只要偏一点,就不能互换。

因此,这类系统至少同时处理四层约束。第一层是语法有效,命令能被CAD内核执行;第二层是几何相似,实体的体积、表面和关键特征接近设计意图;第三层是参数与拓扑合理,模型保持可编辑性而不是生成一团“烘焙后”的表面;第四层是装配正确,多个零件在姿态、比例、配合和功能链上共同成立。七篇论文的演进,本质上就是评测与训练逐层从第一层向第四层移动。

二、DeepCAD:先让神经网络读懂“建模历史”

2021年的DeepCAD提供了这条路线的基础表示。它没有把CAD当作一张图片,而是把草图与拉伸操作整理为固定长度的命令序列。不同命令拥有不同参数,连续尺寸又很难直接稳定回归,因此论文把参数统一到固定槽位,并量化为256级离散值。这样一来,CAD历史就像一段带有严格语法的语言,可以交给Transformer编码、重建,再在潜空间中生成。

DeepCAD官方示意图:输入是草图与拉伸构成的命令历史,网络学习序列表示,输出仍可导出为标准CAD实体。图片来源:论文官方仓库。

这一设计的价值不只在于“用了Transformer”。更关键的是,它保留了设计步骤。工程师拿到结果后,仍可能调整草图尺寸、拉伸深度或布尔关系,而不是只能面对不可编辑网格。官方仓库还提供STEP导出路径以及命令准确率、参数准确率、Chamfer距离和无效率等评价脚本,说明研究对象从一开始就是程序与几何的联合结果。

不过DeepCAD主要做无条件重建和随机生成,训练分布集中在公开CAD数据中的机械零件。它证明了命令序列“能学”,却没有解决用户如何通过自然语言、照片或工程图表达意图。后续工作几乎都建立在这个表示选择上,再向条件输入和真实场景扩展。

三、Text2CAD:把人话翻译成草图与拉伸

Text2CAD把问题推进到交互层:用户不再提供已有CAD文件,而是说“做一个中间带圆孔的长方体”,模型逐步预测草图坐标、曲线类型、拉伸参数和结束标记。论文用预训练BERT编码文字,再通过适配层把通用语言嵌入拉向CAD语义,Transformer解码器则在每一层用交叉注意力读取文字条件,自回归生成完整命令序列。

Text2CAD结构图:文字编码与已生成的CAD子序列在解码器中逐层交互,下一步命令由此前建模历史和文字共同决定。图片来源:论文。

这项工作特别处理了描述粒度差异。初学者可能只描述外观,专家则会明确草图、尺寸和操作顺序;模型需要在信息不足时补全合理结构,在信息充分时忠实执行。论文同时采用命令元素F1、几何Chamfer距离、无效率,以及人类和GPT-4偏好评价。这个组合已经暴露出一个长期矛盾:序列与参考答案不同,不等于最终形状错误;最终形状相似,也不等于建模历史优雅。

其工程意义是降低原型建模门槛,而不是取代精确设计。自然语言缺少公差、材料、载荷和制造工艺等信息,模型可以快速搭出第一版,但无法凭一句外观描述自动补齐全部工程约束。文本生成CAD更适合作为起稿器与教育工具,最终责任仍要落到可检查的参数和规则上。

四、CAD-MLLM:文字、图像和点云进入同一个接口

CAD-MLLM解决的是输入割裂:过去文字一套模型、图片一套模型、点云又一套模型,用户拥有多种证据时反而难以合并。该工作把CAD命令继续视为可自回归生成的序列,借助多模态大模型把文字、图像、点云以及它们的任意组合对齐到同一输出空间。Omni-CAD经数据增强后包含453220个模型,并为每个CAD对象组织文字、多视图、点云和命令序列。

CAD-MLLM流程图:不同输入模态先进入统一多模态模型,再生成可构造CAD实体的命令序列。图片来源:论文。

多模态的真正价值是互补,而不是把输入种类写得更多。单张图片看不到背面,点云可能缺失薄壁和孔洞,文字可以补充功能与尺寸;反过来,图像和点云又能限制文字描述的歧义。论文还提出线段错误、悬空边长度、自交比例和通量封闭误差,用来检测拓扑断裂、开口和自相交。评价从“像不像”推进到“这个边界表示是不是一个健康实体”,这是面向制造的重要一步。

局限同样明显。Omni-CAD的大规模配对数据依赖自动标注与增强,模态之间的噪声会进入训练;命令序列仍集中在有限操作集合,面对自由曲面、复杂倒角、螺纹或企业自定义特征时,覆盖能力并不能由公开结果直接推出。统一入口改善了交互,但不自动等于统一精度。

五、CADFusion:不只学正确命令,还要看渲染结果

CADFusion抓住CAD生成中的“一形多解”。同一个实体可能由不同命令历史构造,如果训练只要求逐词复现参考序列,模型会惩罚那些结果正确但路径不同的方案;同时,自回归损失擅长保证局部token连续,却不一定关注整体外观。CADFusion因此交替进行两种学习:序列阶段学习合法建模语言,视觉阶段把生成程序渲染成图,再由视觉模型打分并构造偏好对,用直接偏好优化把全局形状反馈送回语言模型。

CADFusion官方定性结果:同一文本条件下比较不同方法生成的参数序列及渲染形状,用视觉结果补充单纯序列监督。图片来源:论文。

这个机制把不可微的CAD渲染器变成了可用的训练反馈。它不需要穿过几何内核求梯度,而是问“哪一份程序渲染后更符合目标”。论文与官方仓库提供序列数据、视觉反馈样例、交替训练脚本和多种几何评价工具,复现入口相对完整。

但视觉评分也有代理偏差:某个视角看起来正确,隐藏面、内部孔、壁厚和参数历史仍可能错误;视觉语言模型偏好的“顺眼”未必等于工程可用。因而CADFusion更像是把一个缺失信号补回训练,而不是用视觉评价替代几何内核、约束求解器和工程审查。

六、CADCrafter:真实照片进来,不能只靠纹理猜形状

CADCrafter把输入推进到最常见也最麻烦的场景:随手拍摄的真实产品图。真实照片包含材质、反光、背景、遮挡和视角变化,而训练数据通常来自干净的合成渲染。论文没有直接让模型追逐RGB外观,而是先提取深度与法线,把注意力转向跨域更稳定的几何信号,再用潜在扩散模型生成CAD命令。

CADCrafter方法图:多视图或单视图先转为深度与法线几何条件,经编码与潜在扩散恢复CAD命令;编译器反馈用于偏好优化。图片来源:论文。

另一个关键设计是把CAD编译器当作自动检查器。由于编译过程不可微,论文把能构造有效实体的结果与失败结果组成偏好数据,再用直接偏好优化提高有效性。对于单视图看不到的区域,模型还从多视图编码器蒸馏信息。DeepCAD测试集与论文自建RealCAD真实图像集上的结果共同说明,几何中间表示确实有助于跨越合成到真实的差距。

需要保持克制的是,“从照片恢复CAD”天然是欠定问题。同一张正面图可以对应不同背面结构,模型只能依据训练先验补全。CADCrafter证明了真实输入可进入可编辑程序,却不能保证不可见尺寸就是事实。工程使用时应把结果视为候选设计,并通过更多视角、尺寸标注和人工约束逐步收紧。

七、RealCADBench:代码能运行,为何还远远不够

2026年9月3日公开的RealCADBench是本轮新论文中最关键的“测量合同”。它收集12632项真实工业设计任务,覆盖19类工厂自动化对象,输入包括文字、二维工程图、真实产品照片和渲染图,同时包含零件与装配任务。论文报告的公开比较使用1770项评测切片,不再只看某一种合成分布。

RealCADBench总览:从多种真实工业意图生成FreeCAD程序,并同时检查执行、体积、表面和视觉语义身份。图片来源:论文。

评测采用四个互补维度:程序是否可执行、实体体积交并比、表面交并比,以及基于规则的视觉语义身份判断。六个前沿模型的可执行率约在0.565至0.812之间,实体交并比约在0.2841至0.5379之间,表面交并比约在0.112至0.217之间,而且没有一个模型在所有指标上同时领先。这组结果最重要的结论不是谁第一,而是单一分数会把不同错误混在一起。

例如,一个模型可能稳定输出可运行代码,但只生成粗糙方块;另一个模型外轮廓更像,却留下破面;装配任务中,每个零件都能独立执行,也可能因为错轴、悬空或缺少关键连接而整体失效。RealCADBench把“成功率高”从一个宣传口号拆成可审计的多个问题,也提醒后续论文不能再用执行率代替工业质量。

八、VisCAD:从单个零件走向装配级系统

同日公开的VisCAD给出与RealCADBench配套的模型和系统方案。零件级VisCAD-M1是27B多模态模型,输入覆盖文字、二维工程图、渲染图和真实产品照片,输出可执行FreeCAD Python程序。训练分三阶段:近100万公开CadQuery程序用于建立语法与几何对应,约15万产品图用于扩展工业视觉域,约1万精选样本通过生成—验证—反馈循环恢复细节质量。

VisCAD总览:共享的“意图—程序—形状”抽象连接数据整理、多阶段训练、零件生成和装配级工作流。图片来源:论文。

在PubCADBench与RealCADBench的零件级平均分上,VisCAD-M1报告0.5540,对比表中最强通用模型Gemini-3.1-Pro为0.5496。这个差距只有0.0044,不能被包装成压倒性领先;更有信息量的是,模型用并行采样与自身重排后达到0.5797,说明测试时验证对CAD任务很重要,同时也意味着额外推理成本。

装配级VisCAD-H1不再把问题当作“生成一个更长的程序”。它先解析物料清单,再并行形成零件级中间表示,随后审查配合关系与全局位姿,最后翻译到FreeCAD、SolidWorks或Fusion等后端。50个装配实例上的评审分约为85.0,对比Codex约68.0、Claude Code约52.0。真正的新意是把装配知识显式放进工作流,而不是把所有责任交给一次模型采样。

不过,这一结论仍有三重限制:装配样本只有50个;评价包含视觉模型裁判;27B模型与多次采样的部署成本并不低。论文证明了领域训练和结构化工作流的潜力,但距离在不同企业标准、复杂曲面、真实公差与制造规则下稳定交付,仍需要更大规模的独立评测。

九、七篇论文放在一起,技术路线发生了什么变化

变化一:输出目标从“形状”转为“程序 + 形状”

DeepCAD奠定命令序列表示,后续方法都在保留可编辑历史的前提下增加条件。这个选择提高了任务难度,却贴近真实工作流:工程价值不是生成一个视觉资产,而是生成能继续修改、导出和验证的设计。

变化二:输入从单一文字扩展到证据融合

Text2CAD解决文字到程序,CAD-MLLM统一文字、图片和点云,CADCrafter专门处理真实照片,VisCAD再加入工程图和工业目录图。多模态不是为了界面热闹,而是为了减少欠定性:文字补功能,工程图补尺寸与视图,照片补外观,点云补空间结构。未来更合理的产品形态很可能不是“上传一张图就完成”,而是模型主动追问缺失尺寸并请求补充视角。

变化三:反馈从token正确走向执行、几何与系统功能

CADFusion用渲染视觉反馈修正序列目标,CADCrafter把编译器结果变成偏好,RealCADBench把执行、体积、表面和语义拆开,VisCAD-H1再关注物料清单、配合和功能链。评价越接近交付,单一指标越不够用。最值得延续的方向不是寻找一个万能总分,而是建立能定位错误来源的分层测试。

十、工程价值:哪些环节最可能先落地

第一,概念设计和方案枚举最容易先受益。在需求尚未完全冻结时,系统可以把文字、草图或参考照片快速转换为多个可编辑候选,让工程师把时间集中到约束、材料和制造审查,而不是从空白界面开始。

第二,逆向建模和目录件数字化具有明确价值。大量工厂零部件只有照片、二维图或旧格式文件。CADCrafter与VisCAD展示了从视觉证据生成程序的方向,RealCADBench则提供更贴近目录件和自动化设备的测试环境。即便第一版不能直接制造,只要能减少手工重建步骤,就可能形成真实收益。

第三,企业内部的CAD智能体会比通用聊天机器人更早成熟。企业可以把零件库、命名规范、材料表、标准件和检查规则接入受控工作流,让模型先做受限任务。VisCAD-H1的中间表示思路说明,可靠系统更像“模型 + 规则 + 几何内核 + 审核器”,而不是一个模型包办全部。

第四,评价基础设施本身可能比生成模型更值钱。没有稳定的执行沙箱、几何比较、拓扑检查和装配审计,模型输出很难进入生产。RealCADBench的价值就在于把失败拆成可修复的问题:语法错、实体错、表面错、语义身份错,分别需要不同的数据和训练策略。

十一、局限与风险:距离“自动设计师”还差哪些关

其一是数据覆盖。公开CAD数据大量集中在规则机械零件,复杂曲面、薄壁结构、钣金、螺纹、焊接、布线和企业专用特征覆盖不足。模型在公开基准上的优势,不能直接外推到航空、汽车或医疗器械的完整设计。

其二是隐含工程知识。照片与文字通常不包含公差、材料、载荷、成本、加工能力和安全系数。几何相似只是设计的一部分,真正制造还需要仿真、规范校验、版本管理和责任审批。当前论文主要证明生成与评测能力,并没有证明端到端替代工程签核。

其三是评价者自身可能出错。视觉语言模型适合补充“看起来是否像”,但会受视角、提示词和模型版本影响;交并比又可能忽略关键小孔和配合面。更可靠的做法是把编译、几何、拓扑、视觉语义、装配关系和人工审查并列,并公开每个维度,而不是只保留总分。

其四是成本与可复现性。DeepCAD、Text2CAD和CADFusion提供官方代码入口,但依赖特定版本的CUDA、PyTorch、OpenCASCADE、模型权重和数据;CAD-MLLM、RealCADBench与VisCAD的公开页面尚不足以支持本文完成同条件全量复现。因而文中的模型分数均按各论文设置解读,不做跨数据集冠军排名。

还要看到,工业CAD系统往往连接企业私有零件库、供应链数据和未公开设计。数据治理、访问权限、版本追踪与知识产权并不是模型精度之外的小问题,而是上线条件的一部分。理想系统应保存输入证据、生成程序、内核版本、检查结果和人工修改记录,使一次设计决定可以追溯;若只保留最终网格或一张效果图,出了问题就很难定位责任,也无法把修正沉淀为下一轮训练数据。

十二、龙哥点评:真正的分水岭不是“会不会画”

龙哥的判断是,这一方向最容易被误解为“AI把CAD工程师替代了”,实际更接近把建模流程拆成一组可自动化、可审核的步骤。过去的模型关注生成结果,近期工作开始关注设计意图、程序执行、几何健康、装配关系和系统功能。当评价对象从一张渲染图变成一份可审计的工程交付物,研究才真正靠近产业。

短期内,模型最适合作为候选生成器、重建助手和检查助手:它快速提出方案,几何内核负责执行,规则系统筛掉明显错误,工程师处理公差、载荷和制造决策。长期看,决定胜负的未必只是模型参数,而是谁拥有高质量设计历史、失败样本、企业规则和闭环验证。CAD领域的数据壁垒与流程壁垒,很可能比单次榜单领先更持久。

十三、龙迷三问

1. 既然VisCAD平均分超过通用模型,是否说明专用模型已经全面胜出?
不能。0.5540与0.5496的差距很小,不同子任务上也并非全部领先;并行重排达到0.5797还增加了推理成本。更稳妥的结论是,领域数据和专用流程已经能把中等规模模型推到通用前沿模型附近,并在装配工作流上显示优势。

2. 从照片生成CAD,结果能否直接拿去加工?
通常不能直接承诺。照片缺失不可见面、绝对尺寸、公差、材料和载荷信息。模型可以生成可编辑候选,随后仍需尺寸补全、约束检查、仿真和人工签核。输入证据越完整,结果越可能从“合理猜测”走向工程设计。

3. 团队现在最值得投入模型,还是投入评测?
对多数工程团队,先建设评测与数据闭环更稳妥。没有执行、几何、拓扑和装配检查,再大的模型也难以可靠上线;有了分层评测,团队才能知道失败来自输入、程序语法、几何恢复还是系统装配,并据此选择微调、检索、规则或人工复核。

十四、结论:CAD智能正在从生成演示走向工程闭环

七篇论文串起了一条清晰主线:DeepCAD让建模历史成为可学习序列,Text2CAD让语言进入设计流程,CAD-MLLM统一多模态条件,CADFusion和CADCrafter引入视觉与编译反馈,RealCADBench重写工业评价标准,VisCAD则把零件模型扩展到装配系统。每一步都不是简单放大模型,而是在补一类过去被忽略的约束。

接下来的关键趋势很可能有三条:一是模型主动向用户追问尺寸与约束,减少单视图猜测;二是中间表示跨越不同CAD软件,让设计推理与后端语法解耦;三是评测从静态零件扩展到可运动、可受力、可制造的完整装配。AI生成CAD真正成熟的标志,不是展示图越来越像,而是修改、检查、装配和制造环节都能留下可靠证据。

主要参考资料

1. DeepCAD: A Deep Generative Network for Computer-Aided Design Models
https://arxiv.org/abs/2105.09492
https://github.com/rundiwu/DeepCAD

2. Text2CAD: Generating Sequential CAD Models from Beginner-to-Expert Level Text Prompts
https://arxiv.org/abs/2409.17106
https://sadilkhan.github.io/text2cad-project/

3. CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
https://arxiv.org/abs/2411.04954
https://cad-mllm.github.io/

4. Text-to-CAD Generation Through Infusing Visual Feedback in Large Language Models
https://arxiv.org/abs/2501.19054
https://github.com/microsoft/CADFusion

5. CADCrafter: Generating Computer-Aided Design Models from Unconstrained Images
https://arxiv.org/abs/2504.04753

6. RealCADBench: Benchmarking Parametric CAD Modeling from Industrial Design Intents
https://arxiv.org/abs/2609.03773

7. VisCAD: A Foundation Model Suite with Multimodal Industrial CAD Intelligence
https://arxiv.org/abs/2609.03811

本文依据论文原文、项目页与官方仓库公开资料汇总整理。论文数据与结论以一手材料为准;不同论文的数据集、输入条件与指标并不完全一致,文中未将其分数直接拼成统一榜单。

本文仅作论文解读与研究讨论,不构成工业设计、制造或安全认证意见。涉及实际产品时,应由具备资质的工程人员完成尺寸、材料、公差、载荷、法规与制造可行性审查,并以原论文和正式技术资料为准。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球