← 返回 PaperDaily 视觉与图像

腾讯中科大新研究:关节物体重建不用猜类型,螺旋关节误差骤降98%

关节物体重建一直是机器人操作里的硬骨头,以前的方法要么依赖关节类型先验,要么遇到螺旋关节就翻车。REArtGS++ 直接拿两张不同状态的多视角 RGB 照片,就把零件级网格、关节参数一起端出来,螺旋关节误差比之前最好的方法降了一个量级,单卡 4090 只要 20 分钟,值得一读。

腾讯中科大新研究:关节物体重建不用猜类型,螺旋关节误差骤降98%

paperdaily_reaction_gif


原论文信息如下:
论文标题:
REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting
发表日期:
2025年11月

发表单位:
中国科学院合肥物质科学研究院、中国科学技术大学、合肥工业大学、腾讯 RoboticsX、上海交通大学

原文链接:
https://arxiv.org/pdf/2511.17059.pdf

项目链接:
https://sites.google.com/view/reartgs2/home

引言:抽屉、冰箱与机器人的共同难题

先想一个场景:冰箱门、抽屉、剪刀、笔记本电脑——这些日常物件有什么共同点?它们都是「关节物体」,由多个部件通过旋转、平移或者更复杂的运动副连接而成。对人类来说,看一眼就知道抽屉是「拉出来的」、冰箱门是「转开的」、剪刀是「绕着铆钉转的」。但对机器人来说,这件事难到让人挠头。
为什么难?因为机器人想操作一个抽屉,光知道「这里有东西」远远不够,它需要知道哪个部位是把手、哪个部位是滑轨、绕着哪根轴运动、能拉多远、转多少度。这些信息对应到计算视觉里,就是两个核心任务:零件级表面重建(把每个部件的几何形状建出来)和关节参数估计(把运动轴、旋转中心、平移量算出来)。有了这两样,机器人才知道怎么用力、往哪个方向用力。
更麻烦的是,关节物体的运动方式并不单一。抽屉是平移,冰箱门是旋转,而像螺丝刀、可调节台灯这种,则是旋转和平移同时发生的螺旋运动。如果算法只能处理其中一种,碰到螺旋关节就彻底歇菜。而且,真实世界中的物体千奇百怪,一个模型如果只在训练过的类别上有效,换个新物体就崩,那在机器人操作这种开放场景里基本没法用。
先把话说在前头:这篇论文的活儿,干得确实漂亮。关节物体重建这个方向,之前的坑有多深,做过机器人的朋友都懂。REArtGS++直接拿两张不同状态的RGB照片,把螺旋关节这种老顽固也收拾得服服帖帖,旋转角度误差从六十多度直接砸到0.07度,这个数字背后是实打实的方法设计,不是调参调出来的。

关节物体重建为何如此困难?

所谓关节物体,就是像抽屉、冰箱门、剪刀、笔记本电脑这种由多个部件通过运动副连接起来的东西。想操作它们,机器人不光要知道每个部件长什么样,还得知道哪个部件绕着哪根轴转、往哪个方向平移、能运动多少。对应到技术里就是两个核心任务:零件级表面重建关节参数估计
难在哪?首先,关节物体的部件之间运动关系是多样的,旋转、平移、螺旋各不相同;其次,不同类别的物体外形差异巨大,训练好的模型很难泛化到没见过的类别;最后,也是最关键的一点,机器人操作只靠单个状态的照片是不够的,必须知道部件动起来之后的样子。
过去的方法各有各的难处。ASDF和DITTO这类生成式方法需要昂贵的3D监督,换一个类别基本就废了。PARIS虽然做到了类别无关,只用两个状态的多视角RGB图像就能重建,但它是基于神经隐式场的,多部件感知能力弱,动态表面的平滑重建也做不好。到了ArtGS和REArtGS,它们把3D高斯溅射(3DGS)引入进来,效率和效果都有提升,但新问题又冒出来了:它们都依赖关节类型先验,得提前确定关节是旋转还是平移,一旦遇到螺旋关节或者多部件物体就抓瞎。
图1:给定任意两个不同状态的多视角RGB图像,本文方法无需任何外部模型即可实现高质量的零件级动态重建和关节参数估计。
图1:给定任意两个不同状态的多视角RGB图像,本文方法无需任何外部模型即可实现高质量的零件级动态重建和关节参数估计。
还有个更难缠的问题:训练数据只有两个状态,而关节参数和高斯图元是联合优化的。状态之间缺少几何约束,就会导致没见过的中间状态重建效果崩坏,而且这种几何约束的缺失还会反过来拖累关节参数估计的精度。REArtGS之前试着引入有向距离场(SDF)来加强几何约束,但SDF是静态映射,做不了时间维度的正则化,等于还是没把动态过程真正约束起来。
此外,还有一个常被忽视的细节:多部件物体的部件数量往往不是固定的。一个抽屉柜可能有三个抽屉,另一个可能有五个。如果方法要求预先指定部件数量,那在实际应用中就得额外加一个部件数估计模块,这又引入了一层不确定性。REArtGS++虽然也需要指定部件数k,但它在分割的鲁棒性上做了不少工作,让这个超参数的影响尽可能小。

从REArtGS到REArtGS++:三大关键改进

REArtGS++这篇论文,就是冲着上面这些痛点来的。它的三大核心改进可以说是刀刀见血:

第一个改进:解耦螺旋运动建模。不再预先判断关节类型,而是把每个关节的运动参数统一建模为螺旋运动,旋转和平移解耦开,联合优化部件分割和关节参数。

第二个改进:时间几何约束。先借助平面高斯溅射拿到准确的法线和无偏深度,再用泰勒一阶展开把法线和深度的一致性约束从两个离散状态扩展到整个时间区间 [0,1]。

第三个改进:局部一致性投票。针对相邻部件边界处的高斯分割模糊问题,通过局部区域投票来引入空间上下文信息,让分割边界更干净。

这三个改进分别对应了关节参数估计、动态几何重建、部件分割三大难题,配合起来实现了从两个状态到任意中间状态的完整动态重建。下面一个一个拆开看。

解耦螺旋运动:告别关节类型先验

先解释一下什么是螺旋运动。想象一下拧瓶盖或者转螺丝刀:部件一边旋转一边沿着旋转轴平移,这种复合运动就是螺旋运动(Screw Motion)。严格来说,纯旋转和纯平移都是螺旋运动的特例——一个平移量为零,一个旋转量为零。所以如果能直接建模螺旋运动,旋转、平移、螺旋就能一网打尽,根本不需要提前猜关节类型。
图2:REArtGS++整体框架。本文方法利用任意两个状态的多视角RGB图像联合优化部件分割、关节参数和平面高斯,实现对未见关节物体任意状态的高质量零件级网格重建和准确的关节参数估计。
图2:REArtGS++整体框架。本文方法利用任意两个状态的多视角RGB图像联合优化部件分割、关节参数和平面高斯,实现对未见关节物体任意状态的高质量零件级网格重建和准确的关节参数估计。
REArtGS之前是怎么办的?它把高斯运动建模成旋转或平移的时间插值,等于先画了个框框:关节只能是这两种之一。ArtGS用双四元数学运动,但没有显式建模旋转关节的枢轴点,导致枢轴和平移纠缠在一起,螺旋运动照样估不准。REArtGS++的解法很直接:把每个关节的参数解耦成四元数 q(θ,a)、枢轴点 o、平移量 t 三部分,全部作为可训练参数端到端优化。
当然,每个高斯图元具体属于哪个部件,是不知道的。REArtGS++的做法是用Mahalanobis距离来度量高斯中心到各个部件中心的相似度,再配合一个MLP学到的残差项,算出每个高斯属于每个部件的分割概率。有了分割概率,高斯的运动就是各部件运动的加权平均——这就是部件运动混合(Part Motion Blending):
公式:μᵢ(t) = Σⱼ mⱼ [Rⱼ(q(t))(μᵢ - oⱼ) + oⱼ + tⱼ(t)]
公式:部件运动混合公式。μᵢ(t)是第i个高斯在状态t的位置,mⱼ是分割概率权重,Rⱼ(q(t))和tⱼ(t)是部件j的旋转矩阵和平移量,oⱼ是枢轴点。
这里有个细节值得注意:REArtGS++把标准状态(canonical state)定义在 t*=0.5。这样一来,旋转角度 θ 被限制在 [-π/2, π/2] 范围内,巧妙地避开了指数坐标在角度大于π时的奇异值问题。旋转和平移随时间的变化也做了归一化处理,从标准状态出发向两端外推,保证两个观测状态的一致性。
公式:θ(t) = (t-t*)/t* · θ,t(t) = (t-t*)/t* · t
公式:旋转角度和平移量随时间变化的线性归一化。t*是标准状态,取0.5;θ和t是最终要估计的关节参数。
公式:q(t) = cos(θ(t)/2) + a·sin(θ(t)/2)
公式:时间相关的旋转四元数。a是旋转轴方向的单位向量,θ(t)是当前状态的旋转角。
这套解耦设计的妙处在于:部件分割、关节参数、高斯几何三者在一个框架里联合优化,分割概率既是运动混合的权重,又是部件归属的依据。整个过程完全不需要额外的关节类型识别管线,也不需要预设阈值。
值得一提的是,这种解耦建模方式还有一个额外的好处:它天然支持多部件物体的运动分解。每个部件都有自己的螺旋运动参数,部件之间互不干扰。即使某个部件是固定的(比如抽屉柜的柜体),它的运动参数也会被优化成接近零,不会影响其他部件的估计。

时间几何约束:让动态重建更精准

螺旋运动解决了关节类型的问题,但几何约束的缺失还是个大隐患。REArtGS++的思路是先让高斯变得"平",再用时间维度的法线-深度一致性把动态过程约束住。
为什么要平面高斯?普通3D高斯是椭球状,渲染出来的法线和深度都有偏差。PGSR(Planar Gaussian Splatting)的工作证明,如果通过尺度损失把3D高斯压扁成平面,就能获得准确的法线估计和无偏深度图,深度值就是光线与高斯平面的真实交点,没有偏移。REArtGS++直接借用了这个思路:
公式:L_scale = (1/N_G) Σ||min(s₁,s₂,s₃)||
公式:尺度损失,通过惩罚高斯三个尺度方向的最小值,把3D高斯压成平面。s₁、s₂、s₃是高斯在三个方向上的尺度。
公式:D(ρ) = d / (N(ρ)K⁻¹ρ̃)
公式:无偏深度估计。d是高斯平面到相机中心的距离,N(ρ)是法线贴图,K是相机内参矩阵,ρ̃是图像平面上的齐次坐标。
有了准确的法线和深度,PGSR的做法是让从深度图估计的法线(对深度图取局部patch叉积)与直接渲染的法线对齐。但这里有个问题:这种约束只能作用在单个离散时刻。两个状态各自约束一下,中间状态呢?没人管。
REArtGS++给出的解法很漂亮:用泰勒一阶展开把法线随时间的变化显式建模出来。在观测状态t₀处的法线,可以近似为法线本身加上法线对时间的导数乘以时间差:
公式:N(ω,t) ≈ N(ω,t₀) + lim(dN(ω,t)/dt)·(t-t₀)
公式:法线关于时间的泰勒一阶展开。ω是关节参数,t₀取0或1(即观测状态),这样在计算颜色渲染损失的时候,深度和法线可以通过一次前向传播同时得到。
那法线对时间的梯度怎么算?直接用有限差分近似:用当前状态t的法线减去标准状态t*的法线,除以时间差。由于标准状态的高斯不施加运动变换,这个近似既省计算量,又能避免优化过程中运动误差的累积。标准状态的法线不参与反向传播,显存也省了。深度估计的法线也做同样的近似,然后构造时间连续的几何约束损失:
L_geo = (1 - ∇I(t₀)) · ( ||N̄(ω,t₀) - N(ω,t₀)|| + ||∇N̄(ω,t₀) - ∇N(ω,t₀)|| )
其中∇I(t₀)是图像梯度,用来屏蔽图像边缘区域的无效计算。第一项保证离散观测状态的法线一致,第二项保证整个时间区间内法线变化趋势一致。一句话总结:从"两个点"的约束升级成了"一条线"的约束。
此外,针对距离基分割在边界区域容易出现概率模糊的问题,REArtGS++还加了一个局部一致性投票模块。简单说:先用K近邻找出边界高斯(周围邻居跟自己的部件归属不一致比例超过阈值β的),再用K-means把边界高斯分成4×k个局部区域,每个区域内部按距离加权投票出一个分割概率分布,最后用KL散度让每个边界高斯的概率分布跟区域投票结果对齐。相当于让边界高斯"问问邻居的意见",分割自然更干净。
这个投票机制的设计还有一个精妙之处:它只在边界高斯上生效,内部高斯不受影响。这样既保证了分割边界的清晰度,又不会过度平滑掉内部高斯的合理差异。消融实验显示,去掉投票模块后,分割质量明显下降,说明这个看似简单的设计确实抓住了问题的关键。

实验验证:全面超越现有方法

实验部分,REArtGS++在PARIS数据集、ArtGS-Multi数据集(额外加了两个螺旋关节物体)以及真实世界数据集上跟PARIS、DTA、ArtGS、REArtGS四个方法做了全面对比,所有对比方法都没有使用深度监督,保证公平。
表格1:PARIS数据集上的定量结果。所有方法均在无深度监督条件下实现公平比较。轴位置结果以毫米为单位。‘-’表示该物体只包含平移关节。加粗表示最好结果,下划线表示次好结果。
表格1:PARIS数据集上的定量结果。所有方法均在无深度监督条件下实现公平比较。加粗表示最好结果,下划线表示次好结果。
在PARIS数据集的合成物体上,REArtGS++的轴方向误差(Axis Ang)大部分物体都达到了全场最低,比如Fridge从REArtGS的0.02降到0.01以下,Oven从0.07降到0.01以下;轴位置误差(Axis Pos)同样全面领先。真实物体上优势更明显,平均CD-m(动态部件表面距离)从REArtGS的89.33直接降到1.75,这个差距已经不是"一点点提升"能解释的了。
表格2:ArtGS-Multi数据集(含额外2个螺旋关节物体)上的定量结果。由于部件数量较多,报告所有可运动部件的平均指标。螺旋物体的部件运动误差按平移|旋转分解。轴位置结果以毫米为单位。
表格2:ArtGS-Multi数据集(含额外2个螺旋关节物体)上的定量结果。螺旋物体的部件运动误差按平移|旋转分解。
真刀真枪的考验在ArtGS-Multi加螺旋关节物体的设定里。普通物体上REArtGS++的轴方向误差平均只有0.55度,而REArtGS是49.43度,ArtGS是25.08度;螺旋物体上更夸张,REArtGS++的轴方向误差平均0.07度,ArtGS和REArtGS分别是64.93和67.13度——这是两个数量级的碾压。关节运动误差方面,螺旋物体的旋转分量从REArtGS的54.82降到0.4左右,基本上是从"完全估错"到"几乎精确"的跃迁。
图3:ArtGS-Multi数据集上起始状态和结束状态的动态表面重建定性结果,同时展示部件分割和表面网格。红色箭头表示关节。
图3:ArtGS-Multi数据集上起始状态和结束状态的动态表面重建定性结果,同时展示部件分割和表面网格。红色箭头表示关节。
从定性结果图3可以直观看到,REArtGS++在多部件物体的分割和网格重建上都要干净不少,部件的边界更清晰,关节位置也更准。像Table 31249这种五部件物体,ArtGS和REArtGS的分割结果几乎是一团乱麻,REArtGS++依然能给出清晰的部件划分。
图4:PARIS数据集上起始状态和结束状态的动态表面重建定性结果,同时展示关节建模和表面网格。
图4:PARIS数据集上起始状态和结束状态的动态表面重建定性结果,同时展示关节建模和表面网格。
消融实验部分,REArtGS++分别验证了三个关键组件的贡献。表格3展示了去掉解耦螺旋运动、去掉投票、去掉几何约束后的性能变化,可以看到每个组件都有不可替代的作用。表格4进一步对比了不同几何约束变体的效果,验证了时间维度的法线一致性约束(包括法线对齐和法线梯度对齐)对最终结果提升最为显著。
表格3:关键组件消融实验。报告ArtGS-Multi和2个螺旋关节物体上的平均结果。轴位置结果以毫米为单位。
表格3:关键组件消融实验。报告ArtGS-Multi和2个螺旋关节物体上的平均结果。
表格4:时间几何约束消融实验。报告ArtGS-Multi和2个螺旋关节物体上的平均结果。
表格4:时间几何约束消融实验。报告ArtGS-Multi和2个螺旋关节物体上的平均结果。
图6:投票和几何正则化的消融定性结果,使用分割渲染结果进行直观可视化。
图6:投票和几何正则化的消融定性结果,使用分割渲染结果进行直观可视化。
图6的消融可视化更有说服力:去掉局部一致性投票后,部件边界处的分割明显出现斑驳和毛刺;去掉几何正则化后,整体的分割和重建质量都有所下降。两者都加上之后,分割边界变得干净利落。
图7:真实世界物体上起始状态和结束状态的零件级表面重建定性结果。
图7:真实世界物体上起始状态和结束状态的零件级表面重建定性结果。
真实世界数据的表现同样稳健。面对真实冰箱和抽屉,REArtGS++重建出的表面网格细节更丰富,关节位置的估计也更贴合实际结构。这说明方法不是只在仿真数据里自嗨,而是真的具备一定的泛化到实际场景的能力。
除了定量指标,论文还报告了训练效率。在单张NVIDIA RTX 4090上,REArtGS++的优化过程大约需要20分钟,相比基于神经隐式场的方法动辄数小时的训练时间,效率提升非常明显。这主要得益于3DGS的显式表达和高效的栅格化渲染,使得梯度计算和参数更新都更加轻量。

局限与未来展望

REArtGS++虽然效果惊艳,但也不是没有问题。首先,物体的部件数量k需要预先指定,这在实际场景中意味着得额外加一个部件数估计模块,不然遇到没见过的新物体还真不知道手该往哪儿放。其次,方法依赖多视角RGB图像和对应的相机位姿,数据采集的门槛还是有的,离"随手拍一段视频就能建模"还有距离。
另外,当前的验证场景主要集中在室内家具和桌面物体,对于更复杂的室外关节物体或者大规模场景,效果如何还没有充分验证。如果能结合分割大模型(比如SAM、DINO)的先验知识,或者把k的估计也融入端到端优化,这个框架的实用价值还会再上一个台阶。
还有一个值得注意的点:时间几何约束的有效性依赖于平面高斯的假设。如果物体表面本身就不是平面(比如曲面或者有大量细节的复杂表面),平面高斯近似可能会引入一定的偏差。论文的实验主要集中在相对平整的家具表面,对于曲面物体的表现还需要进一步验证。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?REArtGS++ 提出基于平面高斯溅射的关节物体重建新框架,无需关节类型先验,通过零件级混合螺旋运动与时间几何约束,仅用两个状态的多视角 RGB 图像即可实现零件级网格重建与关节参数估计,在合成与真实数据上全面超越现有方法。
这篇工作最值得看的点是什么?在PARIS数据集和ArtGS-Multi数据集上,所有指标均取得最优或次优结果;在螺旋关节和多部件物体上优势显著,轴角度误差从数十度降至0.55度以下
这篇工作的边界或风险在哪里?优点:(1)无需关节类型先验,通过解耦螺旋运动统一建模旋转/平移/螺旋关节;(2)提出时间连续几何约束,利用泰勒一阶展开将正则化从离散状态扩展到连续时间区间;(3)局部一致投票机制有效解决边界高斯分割模糊问题;(4)在合成和真实数据上均取得SOTA效果。缺点:(1)对透明物体重建效果有限;(2)需要两个状态间的相机位姿对齐;(3)依赖K-means初始化,对初始聚类质量敏感。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出基于平面高斯泼溅与时间几何约束的可泛化关节物体重建框架,通过解耦螺旋运动建模实现无关节类型先验的部件级重建与关节参数估计。

实验合理度:★★★★☆

Chamfer Distance(CD-w/CD-s/CD-m,分别对应整体/静态部件/动态部件)、轴角度误差(Axis Ang.)、轴位置误差(Axis Pos.)、部件运动误差(Part Motion)

学术研究价值:★★★★☆

提出基于平面高斯泼溅与时间几何约束的可泛化关节物体重建框架,通过解耦螺旋运动建模实现无关节类型先验的部件级重建与关节参数估计;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

单张RTX 4090 GPU上每个物体约16-20分钟(30,000次迭代),显著快于REArtGS(约70分钟)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:高斯分割模糊问题;(4)在合成和真实数据上均取得SOTA效果。缺点:(1)对透明物体重建效果有限;(2)需要两个状态间的相机位姿对齐;

主要参考文献

[1] REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting. arXiv:2511.17059, 2025.
[2] REArtGS: 关节物体重建相关工作,见原文引用[23]。
[3] ArtGS: 基于3DGS的关节物体重建,见原文引用[13]。
[4] PARIS: Part-level Articulated Reconstruction with category-agnostic neural radiance fields,见原文引用[12]。
[5] PGSR: Planar Gaussian Splatting for accurate normal and depth,见原文引用[1]。
[6] 3D Gaussian Splatting for Real-Time Radiance Field Rendering, Kerbl et al., 见原文引用[9]。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!     &


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球