← 返回 PaperDaily
视觉与图像
27B模型硬刚GPT-5.5与Gemini:工业CAD多模态生成险胜0.8%
传统印象里,CAD建模是工程师坐在电脑前,对着软件菜单点点拖拖,从草图拉伸、切除、倒角一路做到出工程图。
龙哥读论文
发布于 2026-09-05 00:31:07
阅读 8
查看原文
原论文信息如下:
传统印象里,CAD建模是工程师坐在电脑前,对着软件菜单点点拖拖,从草图拉伸、切除、倒角一路做到出工程图。但这两年大模型起来之后,事情正在起变化:CAD建模完全可以被看成一种“多模态程序生成”任务——用户把设计意图用文字、图片甚至照片丢给模型,模型输出一段能执行、能出三维实体的程序代码。意图千变万化,程序却只有一套规矩,这不就是AI最擅长的事吗?
可惜理想很丰满,现实很骨感。龙哥长期观察下来,市面上做CAD生成的方向大致分成两种:一类是专用小模型,输入“窗口”很窄,只会吃文字或者只会吃渲染图,稍微遇到真实场景就开始犯迷糊;另一类是通用前沿大模型,啥都能聊,但真让它按某个CAD软件接口生成严谨的建模代码,水平又忽高忽低,稳定性堪忧。工业界真正想要的,其实是既有广度又有深度的“六边形战士”:给一句产品描述能做,给一张二维工程图也能做,给一张车间里实拍的产品照片,最好也能做。
这篇由JoyIndustrial VisCAD团队提出的VisCAD系列,正是冲着这个目标去的。它没有把CAD生成当作单一的“文本出程序”或者“图片出程序”,而是把所有的数据资源都归约到一组统一的三元组抽象上:设计意图、可执行CAD程序、三维形状。零件级任务由27B参数的VisCAD-M1负责,装配级任务则由领域特定的执行框架VisCAD-H1负责。一句话总结:它想做工业CAD智能里的“瑞士军刀”,把散落的各种设计输入统一收编。
从零件到装配:27B模型VisCAD-M1的三阶段训练秘诀
先看零件级生成。所谓零件级,就是只生成单个三维实体,比如一个法兰盘、一个电机外壳、一个支架。VisCAD-M1是一个270亿参数的多模态模型,输入可以是文字描述、二维图纸、渲染图或者真实产品照片,输出是符合FreeCAD API的Python程序。这段程序必须能顺利执行,并导出与设计意图一致的三维形状,孔位、凸台、安装面这些“身份特征”都得保留。
训练这套模型最大的障碍不是模型结构,而是数据。互联网上开源CAD程序虽然不少,但很多程序跟真实设计意图对不上号:有程序没图,有图没程序,甚至图和程序都对上了但程序根本跑不通。如果像传统做法那样,直接把所有数据一股脑拿来让模型“看图说话”,模型的CAD语法可能学会了,工业视觉分布却完全没覆盖。VisCAD团队因此设计了一条三阶段训练流水线,每一阶段都踩在上一阶段的肩膀上。下面这张图把流水线总结得很清楚。
第一阶段叫中间训练。团队收集了接近100万个公开的CadQuery CAD程序,在本地环境逐一执行,导出三维实体,再从不同视角投影成多视图图像。也就是说,模型看到的每一张渲染图背后,都有一份已经验证过可执行的“标准答案”程序。这种“可逆构造”给模型打了非常好的底子:CAD语法、API调用、渲染特征和代码片段的对应关系,都在这个阶段被模型吸收了。
第二阶段叫鲁棒监督微调,原文写作Robust SFT,SFT的全称是Supervised Fine-Tuning,也就是监督微调。这里的“鲁棒”体现在多对一的训练策略上:对同一张产品图,团队让教师模型生成多个候选CAD程序,并进行筛选验证。这样模型学到的不是某一条“独木桥”路径,而是同一意图下多种合理建模方案的分布,对单条噪声轨迹的敏感度大幅降低。
第三阶段叫持续高质量微调。大约1万个经过精挑细选的样本,配合“生成-验证-反馈”的闭环来训练。前两个阶段保证模型“见过世面”,第三阶段则负责修复细节几何精度,防止模型在大规模工业数据冲刷下丢掉对圆角半径、孔距公差这类细节的敏感度。
这套设计的聪明之处在于:数据量大的阶段训练粗粒度能力,数据量小但质量高的阶段打磨精度,把不同来源、不同质量的数据物尽其用。模型在每一层都往“可执行、可编辑、可视觉验证”的目标逼近一步。
超越通用大模型:领域特定框架VisCAD-H1的装配智能
零件生成是地基,装配级生成才是真正让CAD智能从“玩具”走向“产品”的关键一步。装配不是把几个零件生成各自跑通就完事,还要考虑零件之间怎么配对、每个零件装在哪里、装配顺序是否合理、A零件动了之后B零件会不会跟着联动。一句话概括:装配设计的错误是级联放大的,一个接口错位,整台设备都白搭。
通用代码助手能不能做装配?能,但很勉强。它们执行一下程序、看一眼报错、改一改再跑,本质上是在“试错”,并没有把“一台设备应该拆成哪些零件”“每个零件之间的配对关系是什么”这件事显式地推理出来。结果往往是:程序能跑通,导出的却是一个没有内部机构的空壳,或者压根导不出来。
VisCAD-H1的思路是围绕领域知识搭一个外循环,下面这张图展示了它的完整工作流。整个流程由四个带“门控”的阶段组成:第一,多模态理解与物料清单生成,把产品图片、多视图图纸和文字描述转成零件清单、数量、装配顺序以及配对/边界提示;第二,并行零件IR生成,IR是Intermediate Representation的缩写,即中间表示,每个零件先生成一份与具体CAD平台无关的局部几何描述,包括接口和约束;第三,全局IR审查,把所有零件的IR放到一起,结合参考视图检查跨零件几何、接口和整体位姿,最终输出带位姿的修正IR;第四,CAD实现,把审查通过的IR翻译成具体CAD后端的建模调用,并行构建零件再装配成整体。
这个IR是整套框架跨平台能力的灵魂。同一个装配设计方案,只要IR固定下来,就可以翻译到FreeCAD、SolidWorks或者Autodesk Fusion三种CAD环境。通用代码助手拿到一个环境就套一套提示词,换个软件等于换了个世界,而VisCAD-H1先做平台无关的规划,再做平台相关的翻译,天然具备更强的可移植性。下图很直观地展示了这种跨平台稳定性差异。
实验数据也支持这套领域化设计的价值。在一个从PubCADBench和RealCADBench各取25条、共50条装配任务的对比测试中,VisCAD-H1的装配评审得分约为85.0分,而OpenAI Codex为68.0分,Claude Code为52.0分。要知道,几乎所有配置都能成功导出装配体,有效样本数分别是49、49、50,说明得分差距并非源于“能不能跑”,而是源于“装配得对不对”。
从图6的典型样例里可以看到很明显的模式:Codex经常能恢复一个大致的“外壳”,但内部机构经常缺席,比如有了体育场底座却没有连杆,有了径向轮毂却没有活塞;Claude Code则更常出现拓扑变形或者导出失败。VisCAD-H1因为有物料清单和IR这两道强制关卡,即使外壳轮廓已经出来了,也还是会继续检查曲柄销、导轨、活塞数量、散热鳍片、调节器端口、压缩机储气罐和泵这些局部细节。这个优势,本质上就是“显式结构规划”对“自由发挥式编程”的胜利。
数据为王:创新数据整理管道如何突破CAD数据稀缺瓶颈
读到这里,细心的读者一定会问:训练VisCAD-M1需要海量“意图-程序-形状”配对数据,这些数据到底从哪来?要知道,工业设计数据大多分散在企业内部,开源CAD数据集虽然存在,但普遍只在ABC、DeepCAD、Fusion 360 Gallery这类CAD原生合成数据上打转,真实照片和二维工程图非常稀缺。数据,才是AI CAD落地的第一瓶颈。
VisCAD团队给出的解法是一条完整的“数据整理管道”,核心思路可以概括成一句话:别被动等现成数据,要主动把不完整的三元组补全。底层的原始数据来源主要有三类:公共语料库提供可执行的CAD程序和渲染图;工厂自动化产品目录提供SKU级别的真实产品照片;采购和收集的工业资产提供STEP/STL模型与二维工程图。
拿到原始数据后,第一步是过滤。团队设计了一套四步分类过滤流程,把软件、电子产品、消费品这类“弱CAD”类别剔除,只保留具有清晰建模、配对或制图价值的刚性机械产品,最终形成21个大类和128个子类。下图展示了类别体系的构建过程。
过滤后的数据进入正向和反向两条加工路径,正如图2展示的这样。如果从意图出发,首先用现成的图像编辑模型对意图做标准化和降噪,再用现成的图生三维模型重建出可能不够完美的形状,最后通过基于递归自我改进的程序搜索流程,寻找能还原形状的最优程序。递归自我改进的英文是Recursive Self-Improvement,简称RSI,这套策略可以在数量优先的“快速模式”和质量优先的“慢速模式”之间切换。如果反过来从程序或形状出发,那么重点就变成了如何获得多样化的意图:对三维形状做多视角投影,再利用图像编辑模型生成不同风格和背景的变体,最后走正向路径补齐验证过的程序。
这套管道的精妙之处在于,它不需要所有数据一开始就是完美的。以“图→程序”转化为例,即便图生三维模型重建出的网格变形了,程序搜索仍然可以通过反复执行、渲染、对比、修正,逼近一个真实可用的CAD程序。而反向路径让生成的意图足够多样,模型不会被某一类渲染风格或者照片角度“带偏”。
这也解释了为什么VisCAD-M1能同时吃下文字、工程图、实物照片和渲染图四种输入:它不是靠某一个花哨的模块,而是靠数据管道把真实工业场景中的异构视觉证据,一一映射到可执行的CAD程序空间。数据到位了,多模态才不是空话。
测试时扩展新思路:让模型自己当裁判提升生成质量
模型训练完之后,还能不能靠“测试时计算”再拔高?这是当前大模型领域最热的话题之一,测试时扩展的英文是Test-Time Scaling,简称TTS。VisCAD团队试了两种很直接的思路:第一种是序列式精修,让VisCAD-M1先看到自己导出模型的六视图,再反复修改初始程序;第二种是并行式重排,对同一个输入采样多个候选程序,然后让VisCAD-M1自己当裁判,从一堆候选里挑出最好的一份。
实验结果很有意思:序列式精修基本没用,模型自己“看着结果改程序”越改越偏;并行式重排却非常有效。换句话说,VisCAD-M1虽然不擅长在生成空间里靠迭代走出更优解,却很擅长在判别空间里选出多个候选中的最优项。“会做”不一定“会改”,但“会挑”已经足够把成绩推高一截。这个发现再次印证了一个判断:对CAD生成来说,验证和选择往往比开放式修正更可靠。
零件级的效果到底怎么量化?这里需要先解释论文使用的综合评价公式。下图中的公式对每个模型计算一个综合得分Pc,它由四项等权构成:程序执行成功率Ec、实体交并比、表面交并比以及归一化后的视觉判断得分Jc/100。实体交并比比较两个三维实体占据空间的交叠程度,表面交并比则更关注实体边界曲面的重合度;视觉判断得分来自一个无真实标签的评判模型Kimi K2.6,让评判模型对比导出三维模型的渲染图和输入意图的相似程度。四项合并,既看重“代码能不能跑”,也看重“形状像不像”,还看重“视觉上对不对”。
表1给出了最终的零件级综合得分对比,这是整个论文竞争最激烈的战场。
可以看到,VisCAD-M1拿下了0.5540的均分,排在第二的Gemini-3.1-Pro是0.5496,GPT-5.5是0.5450,VisCAD-M1的领先幅度其实不大,属于“小比分险胜”。但需要注意,VisCAD-M1是一个270亿参数的领域模型,却能在同时包含工业照片、二维图纸、文字描述和渲染视图的测试集上超过各家千亿级通用旗舰,这本身就是领域化路线的胜利。加上并行测试时扩展后,同一个模型直接跳到0.5797,相对最强前沿模型约有5%左右的相对提升。
表3则展示了并行重排策略在PubCADBench五组数据切片上的具体表现。当采样数k=8且不看思考过程时,综合得分提升约1.3个百分点;k=8开启思考后提升约1.7个百分点;把采样数加大到k=16,得分提升到0.5833,比不做测试时扩展高出约2.4个百分点。从中能清晰地看到推理成本换精度的趋势。
从逐项指标看,两个模型的差距主要集中在几何重合度上。VisCAD-M1在BenchCAD上的实体交并比达到0.4422,CADBench上达到0.5484,都优于对比模型,表面的交并比也同步领先。但在视觉判断得分上,GPT-5.5和Gemini-3.1-Pro反而经常反超。这说明VisCAD-M1生成的三维实体在空间占用率上更贴近参考件,但视觉评判模型认为它的外形在一些“一眼就能看出不同”的局部特征上还有差距。“几何更准”和“看着更像”并不完全等价,这也是后续值得继续打磨的方向。
团队还专门验证了三阶段训练流水线各自的有效性。表2对比了8B和32B两个初始模型在加或不加中间训练的情况下的效果。图中几个可明显量化的信号是:中间训练让多组交并比相关分数提升约1个百分点,而视觉判断分数提升约5个百分点。这说明中间训练的主要价值不仅是让几何更准,更是让模型更理解渲染图像和建模代码之间的语义关联。
图5则验证了鲁棒SFT中“一个意图对应多个候选程序”的增益。在图里,每个输入对应3个候选样本的曲线,在训练末尾多个检查点上稳定优于每个输入只对应1个样本的曲线。同一意图多候选的扰动策略,确实起到了抑制监督信号噪声、提升最终收敛精度的作用。
一句话总结零件级结果:VisCAD-M1在没有动用超大算力堆模型体量的前提下,用更聪明的数据整理和三阶段训练,外加测试时自评判,在真实工业场景上达到了与顶级通用模型相当、局部更优的水平。它证明了在工业CAD这个强调约束、强调可执行性的领域,“专才”确实可以和“通才”掰手腕。
龙迷三问
这篇论文到底在解决什么问题? VisCAD-M1(27B)在PubCADBench与RealCADBench拿到0.5540平均分,超过Gemini-3.1-Pro的0.5496;搭配并行测试时重排抬至0.5797。
这篇工作最值得看的点是什么? VisCAD-M1在PubCADBench和RealCADBench上平均分0.5540,超过最强前沿模型Gemini-3.1-Pro的0.5496;使用parallel-tts测试时扩展后提升至0.5797(相对提升约5%)。装配级VisCAD-H1获得85.0分,远超Codex的68.0和Claude Code的52.0。
这篇工作的边界或风险在哪里? 优点:(1) 提出完整的多模态CAD基础模型套件,覆盖零件级和装配级生成;(2) 数据整理管道创新性地利用现成图像编辑和图像转3D模型处理异构数据;(3) 三阶段训练策略有效利用不同数量和质量的数据;(4) DSL无关中间表示实现跨CAD平台迁移;(5) 测试时扩展策略(parallel-tts)有效提升性能。缺点:(1) 在部分子任务上Judge分数低于对比模型(如2D Drawing上Gemini 79.08 vs VisCAD-M1 69.13);(2) 27B模型参数量大,推理成本高;(3) 装配级评估仅50个实例,规模有限;(4) 与前沿模型的性能差距较小(0.5540 vs 0.5496),统计显著性未报告。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
构建VisCAD基础模型套件,通过27B参数多模态模型VisCAD-M1(三阶段训练:中期训练+鲁棒SFT+持续高质量SFT)实现零件级CAD程序生成,并设计VisCAD-H1领域特定智能体框架(基于DSL无关中间表示IR)实现装配级CAD。
实验合理度: ★★★★☆
执行成功率(Success Rate)、Solid IoU、Surface IoU、视觉语义评判分数(Judge Score,0-100),综合使用profile average公式P_c = 1/4(E_c + G_c^solid + G。
学术研究价值: ★★★★☆
构建VisCAD基础模型套件,通过27B参数多模态模型VisCAD-M1(三阶段训练:中期训练+鲁棒SFT+持续高质量SFT)实现零件级CAD程序生成,并设计VisCAD-H1领域特定智能体框架(基于。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
VisCAD-M1为27B参数模型,未报告具体FLOPs;测试时扩展(parallel-tts)使用k=8或k=16次采样加列表式重排序。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 现有材料尚未充分覆盖分布外泛化、部署成本、长期稳定性和失败案例。
主要参考文献
JoyIndustrial VisCAD Team. VisCAD: A Foundation Model Suite with Multimodal Industrial CAD Intelligence. arXiv:2609.03811.
论文链接:https://arxiv.org/pdf/2609.03811v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!