27B模型硬刚GPT-5.5与Gemini:工业CAD多模态生成险胜0.8%
传统印象里,CAD建模是工程师坐在电脑前,对着软件菜单点点拖拖,从草图拉伸、切除、倒角一路做到出工程图。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
传统印象里,CAD建模是工程师坐在电脑前,对着软件菜单点点拖拖,从草图拉伸、切除、倒角一路做到出工程图。
现在的数字人头像,脸可以以假乱真,头发却像顶了个头盔——怎么晃都是死的。马普所等机构提出PhysHead,把头发拆成一根根发丝并接入物理引擎,让头像在点头、转头甚至刮风时,头发真的会飘。顺便还借大模型把“秃头版”训练数据造了出来,细节拉满。
3D高斯泼溅遇上开放词汇理解,过去大家往点云里硬塞特征,结果存储爆表、边界糊成一片。北大这篇CVPR 2026新作反其道而行,把几何和语义彻底解耦,用VLM生成文本假设做外置索引,直接让特征存储从GB级砍到MB级。思路清奇,落地极香,值得一读!
单张照片就能告诉机器人“杯子把手在哪、椅子坐哪里”?同济大学与中科院最新开源AfordAny,把开放世界3D功能定位做成了端到端流水线,473类基准直接拉满。
斯坦福在CVPR 2026交出的这份P3Sim答卷,把"世界模型"从玄学拉回了工程:概率图模型+自回归Transformer+几何条件化,三大件拼出一个能从单张图推演3D物理变化的模拟器。新视角合成在SEVA基准上RE10K达到21.54的PSNR,3D物体操作在3DEditBench上PSNR冲到23.12。7月底刚聊过同团队PhyWM,这篇更像是把"懂物
关节物体重建一直是机器人操作里的硬骨头,以前的方法要么依赖关节类型先验,要么遇到螺旋关节就翻车。REArtGS++ 直接拿两张不同状态的多视角 RGB 照片,就把零件级网格、关节参数一起端出来,螺旋关节误差比之前最好的方法降了一个量级,单卡 4090 只要 20 分钟,值得一读。
做光场显微的都知道,帧率和空间信息常常“按下葫芦浮起瓢”。这篇来自UCLA的工作,用Fisher信息把SLIM和FLFM在相同探测器带宽下的账算得明明白白:SLIM用更少的行读出,换来了更高的三维信息效率。做计算成像、显微系统设计或者想优化相机读出架构的朋友,值得一读。
3DGS资产正在被“拆零件拼装”式盗用,而现有的渲染级水印在这种局部侵权下几乎集体失灵。浙大这篇NGS-Marker直接对高斯原语下手,任意抠一块都能验明正身,局部侵权场景下解码准确率冲到99%以上,是3D资产版权保护里少见的真痛点工作。
一张照片拍完就定型了?南京大学最新研究告诉你:换视角、拉焦距、调色温、改曝光,一张图就能“重拍”出各种效果,还跟真重新拍过一样。首个统一框架ReX-Shot,直接把单图三要素控制一次搞定。
自动驾驶3D感知,向来是深度、检测、占用各学一套。北航与北邮提出的GeoUP,直接把视觉几何基础模型VGGT改造成统一3D感知骨架,一个模型三大任务全包,在nuScenes、Waymo、Argoverse 2、KITTI、DDAD五大基准拿下SOTA。思路清奇,落地潜力值得关注。
想象你在家里开着VR远程会议,头顶一圈RGB-D相机从六个角度同时拍摄。你以为自己只是坐着聊天,实际上,你手边的手机、墙上的照片、桌上的文件,甚至镜子里一闪而过的倒影,都正被多台相机同步捕捉,并实时融合成一个可自由旋转视。
当只有两张随手拍的模糊照片、还没有相机位姿时,3D重建还能做吗?本论文不仅做了,还用级联的2D→3D引导把Deblur-NeRF真实场景PSNR提升了1.19dB、合成场景提升了2.11dB。这种极简输入设定对XR、手持设备3D内容生成非常有吸引力。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球