论文基本信息
原文标题:REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting
首次公开:2025 年 11 月 21 日
会议:CVPR 2026
原论文:https://arxiv.org/abs/2511.17059
龙哥导读
REArtGS++只用两个状态的多视角RGB,不预判旋转、平移或螺旋关节,就联合恢复部件网格与运动参数;在两类螺旋物体上,平均关节轴角误差达到0.07°。它真正补上的,是两个观测端点之间那条可优化的连续几何轨道。
图1|ArtGS-Multi多部件对象的起始/结束状态对比。每组依次展示REArtGS、ArtGS、REArtGS++和GT,彩色区域是部件分割,红色箭头是估计关节。REArtGS++的分割、关节方向与表面更接近GT;这张图是定性证据,误差大小仍应结合表格指标判断。来源:论文Figure 3。
先看论文最有说服力的一张图。Figure 3把REArtGS、ArtGS、REArtGS++与真值放在同一组多部件对象上比较,红色箭头表示估计的关节;旧方法一旦把关节类型猜错,错误会沿着部件分割、关节轴和网格表面一路传下去,而REArtGS++在起始与结束状态都保持了更稳定的部件对应关系。
进展不只是“网格更漂亮”,而是拿掉关节类型先验,并让未拍到的中间状态也受几何约束。这击中两状态重建最危险的误差源:起点判断错了,后面越优化越自信;只盯两个端点,中途表面则可能塌掉。
01 重建“会动的物体”,难点不只是多一个时间维度
静态物体重建回答的是“哪里有表面、表面长什么样”。关节物体还要回答“哪些表面属于同一部件、部件围绕什么轴运动、轴经过哪里、转了多少、是否还伴随平移”。这几项不是相互独立的:部件分错会污染关节估计,关节估错又会把高斯拉到错误位置,最后生成的网格即便局部逼真,也可能无法正确开合。
早期类别级方法常依赖大量三维监督。PARIS进一步用两个状态的多视角RGB实现类别无关建模,但神经隐式表示把外观、部件和运动缠在一起,多部件感知与平滑动态表面仍然困难。
3D Gaussian Splatting提供了更显式的选择:每个Gaussian有位置、尺度、方向、颜色与透明度,移动哪个点、属于哪个部件都可以直接操作。问题也随之暴露——显式表示让错误更容易被定位,却不会自动告诉系统“这个点该跟哪块门板走”,部件概率与关节参数仍要在只有RGB监督的条件下共同学出来。
图2|任务设定:输入一个未见过关节物体在任意两个状态下的多视角有位姿RGB图像,输出部件级动态表面与关节参数,不借助外部生成模型。图中展示的是任务能力概览,不代表只需两张照片。来源:论文Figure 1。
02 从ArtGS到REArtGS++:三步把先验和几何补齐
纵向看,ArtGS先用两状态RGB-D、显式Gaussian与双四元数实现高效关节重建。但它需要深度,且没有显式拆出旋转轴心;面对螺旋运动或多个可动部件时,预先指定关节类型会成为脆弱环节。
REArtGS把输入推进到纯RGB,并引入SDF几何约束,让两状态重建不再依赖深度传感器。它的问题是SDF映射偏静态:可以在观测状态约束几何,却难以对整段运动过程施加时间连续正则;同时,旋转/平移类型仍需预先决定,类型判断错了会直接带偏关节参数。
REArtGS++再往前走三步:第一,把Gaussian压成平面,以稳定法线和无偏深度支撑几何;第二,把任意刚体关节统一拆成旋转四元数、轴心与平移,不先贴类型标签;第三,用一阶Taylor展开近似法线随时间的变化,把约束从两个离散端点扩展到整个运动区间。它不是单点替换,而是“表示—运动—时间约束”三层一起改。
横向对比:三条路线分别交换了什么
ArtGS:两状态RGB-D;显式Gaussian、效率高;需要深度与关节类型先验,轴心和位移不够解耦。
REArtGS:两状态RGB;用SDF加强表面;静态SDF难覆盖未观测中间状态,仍受关节类型先验影响。
REArtGS++:两状态RGB;平面Gaussian、无类型先验的解耦运动、连续时间几何正则;代价是仍需每个状态60—100张有位姿图像与两状态位姿对齐。
03 先看全链路:它同时优化五类东西
Figure 2从左到右依次是两状态多视角RGB输入、部件概率与关节参数学习、平面Gaussian的颜色/法线/深度渲染,以及任意时间状态的TSDF部件网格提取。
图3|REArtGS++方法总览。Part Seg.学习部件概率,Part Motion Blend用概率混合部件运动,Planar GS提供颜色/法线/深度,Temporal Geometry把端点法线及其时间变化对齐,最后在任意状态提取部件网格;“Diff.”表示差分近似。来源:论文Figure 2。
图3a|移动端局部放大:左侧从粗Gaussian初始化部件中心与关节轴心,中部用相对距离、Mahalanobis距离和MLP学习部件概率,再把关节拆为轴心、四元数与平移。来源:论文Figure 2裁图。
图3b|移动端局部放大:右侧把运动后的平面Gaussian送入法线、RGB和深度渲染;局部投票稳定边界,时间几何分支比较端点法线与差分变化。来源:论文Figure 2裁图。
这里最容易被忽略的是“联合优化”。每个Gaussian的部件概率决定它跟随哪组刚体变换,也会被两状态图像的渲染误差反向修正;运动、渲染、分割和关节因此形成闭环。
总损失由渲染、平面尺度、部件中心、时间几何与局部投票五项组成:L=Lrender+Lscale+Lcenter+Lgeo+Lvote,每项带独立权重。渲染损失负责“看起来像”,其余四项负责防止系统用错误部件、畸形Gaussian或不连续运动来投机。
04 平面Gaussian:为什么把椭球“压扁”反而更懂表面
标准3DGS用三维椭球表示空间体积,适合快速渲染,但椭球最短轴不一定稳定对应真实表面法线,沿视线累积出来的深度也可能有偏。REArtGS++加入尺度损失,对每个Gaussian的三个尺度s1、s2、s3取最小值并整体压低,让一个方向尽量薄,Gaussian就更像贴在物体表面上的小圆片。
尺度损失:Lscale=(1/NG)Σi‖min(s1,s2,s3)‖
NG是Gaussian数量,三个s是每个Gaussian沿三个主方向的尺度。最小尺度越接近0,局部表示越像二维平面;好处是最短轴可以给出法线,射线与平面的交点可以给出更贴近表面的深度。
无偏深度写成D(ρ)=d/[N(ρ)K-1ρ̃]。ρ是像素位置,K是相机内参,N是渲染法线,d是局部平面到相机中心的距离;公式求的是相机射线与该平面的真实交点深度。
这一步的作用不是让所有表面天然正确,而是提供一个可互相检查的“法线—深度”对。深度图局部反投影后可以重新估计法线,再与Gaussian自身渲染的法线对齐。局限也很明确:透明表面、严重反光、遮挡边缘和过薄结构仍会破坏RGB监督或局部平面假设。
05 部件概率不是标签,而是运动混合权重
对一个有k个部件的对象,每个Gaussian维护M={m1,m2,…,mk},表示它属于各部件的概率。论文把每个部件的中心O、方向V和尺度Λ设为可学习参数,用Gaussian中心μ到各部件椭球中心的Mahalanobis距离作为主线索,再由一个MLP补充残差,因此分割既考虑空间邻近,也能修正简单距离模型表达不了的边界。
第i个Gaussian在时间t的位置,是所有部件运动结果的概率加权和:μi(t)=Σjmj[Rj(q(t))(μi-oj)+oj+tj(t)]。mj是部件概率,oj是轴心,Rj是旋转,tj是平移。
直觉上,一个确定属于门板内部的点几乎只跟门板运动;位于门缝边界的点可以暂时保留软分配,让图像监督决定它更该跟谁走。软概率把“分割”和“运动”接成了同一条可微链路,但也会让模糊边界出现两边都沾的错误,因此后面还需要局部投票。
06 不问旋转还是平移:统一写成解耦螺旋运动
论文把每个关节参数写成ω={q(θ,a),o,t}:θ是旋转角,a是三维旋转轴方向,o是轴心,t是平移向量。纯旋转对应t接近0,纯平移对应θ接近0,旋转同时沿轴移动则自然形成螺旋运动;系统不需要先做一次离散分类,再选择不同公式。
时间被归一化为t∈[0,1],中点t*=0.5设为canonical state。角度与平移按(t-t*)/t*插值,四元数q(t)=cos(θ(t)/2)+a·sin(θ(t)/2),再转换成旋转矩阵。把canonical state放在中间,可以让学习到的角度尽量落在[-π/2,π/2],减少指数坐标在大角度下的奇异风险。
这套写法的关键价值是“可退化”:同一参数化能够覆盖旋转、平移和螺旋,而不是让一个前置分类器决定后续优化走哪条路。实验里旧方法在Table 31249和Storage 47468这类多部件对象上出现很大的轴角误差,正说明关节类型先验一旦错,不是少几分,而是会把几何坐标系整体带偏。
07 两个端点之间,怎样补出连续几何约束
两状态监督最容易制造一种假象:起点和终点都能渲染正确,中间却穿插、鼓包或法线翻转。因为关节参数与Gaussian同时优化,只检查t=0和t=1,模型可以走一条端点正确、过程错误的路径;机器人规划和数字孪生真正使用的,恰恰是这段未观测过程。
REArtGS++渲染法线N(ω,t)与深度D(ω,t),再把深度图四邻域反投影到三维并做叉积,独立估计法线N̄(ω,t)。两套法线不仅在端点要接近,随时间变化的趋势也要接近。
Taylor一阶近似:N(ω,t)≈N(ω,t0)+∇N(ω,t0)(t-t0)
差分近似:∇N(ω,t0)≈[N(ω,t)-N(ω,t*)]/(t-t*)
ω是关节参数,t0取观测端点0或1,t*=0.5是canonical state。第一式用端点值与时间导数近似邻近状态,第二式用canonical state构造导数,不必为整段时间逐帧渲染。
最终Lgeo同时惩罚两项:端点处N̄与N的差,以及它们时间梯度的差;图像梯度大的边缘区域被降权,避免深度不连续处的法线估计污染训练。论文还停止canonical法线分支的反向传播,节省显存并减少运动误差在优化早期反复累积。
它并没有真的观察每个中间帧,而是要求“从端点推断出的变化率”与几何自身的变化率一致。因此“连续时间约束”应理解为基于一阶近似的正则,而不是对全部真实中间状态的直接监督;运动高度非线性或端点相距过远时,一阶近似仍可能不足。
08 边界投票、初始化和网格提取:三个容易被摘要省掉的细节
第一是局部一致投票。KNN邻居中不同部件比例达到β=0.2时,该点被视为边界Gaussian;边界点再聚成4×k个局部区域,按距区域中心远近形成投票分布Mvote。
系统通过KL散度让单点分布Mi靠近局部投票分布。它不是粗暴做多数表决,而是只在歧义边界引入空间上下文:大平面内部保留原有判断,门缝、抽屉边缘等容易左右摇摆的位置才听取邻域意见。
第二是初始化。方法先拟合两个状态,根据跨状态Chamfer距离找出动态Gaussian,再用Hungarian匹配得到canonical表示;动态点聚类初始化部件中心,连接区域初始化关节轴心。
第三是输出网格。优化完成后,按最大部件概率把Gaussian分到各部件,在目标时间t应用对应运动,分别渲染RGB与深度,再以0.04体素大小做TSDF融合。最终交付的不是一团只能看的Gaussian,而是可以按部件分离、在任意状态提取的表面网格与显式关节参数。
根据论文方法整理的伪代码
输入:两个状态的多视角有位姿RGB图像,部件数k 分别拟合两组3D Gaussians,识别动态点并匹配到canonical state 初始化部件中心、尺度与关节轴心 重复优化: 把Gaussians压成平面,渲染颜色、深度、法线 由距离与MLP得到每个Gaussian的部件概率 用概率混合各部件的解耦旋转、轴心与平移 计算端点渲染损失与连续时间法线—深度损失 对歧义边界执行局部投票一致性约束 在目标时间变换各部件,并用TSDF提取网格 输出:部件网格、任意状态表面、关节参数
伪代码最关键的是中间四行形成闭环:概率决定运动,运动决定渲染,渲染与几何损失又反推概率和关节。初始化不是可有可无的加速项,因为部件中心和轴心若从完全随机位置起步,早期渲染误差会把错误运动分配进一步放大。
09 实验怎么比:全部去掉深度监督,指标都看误差
实验覆盖PARIS的10个对象、ArtGS-Multi的5个多部件对象、2个新增螺旋对象,以及5个真实对象。每个状态提供60—100张有位姿RGB图像,全部实验在单张RTX 4090上完成。
表面用Chamfer Distance衡量,并乘1000:CD-w看整体表面,CD-s看静态部件,CD-m看动态部件。关节用Axis Ang衡量轴方向角误差,用Axis Pos衡量轴心距离误差;Part Motion同时考察旋转测地误差与平移欧氏误差,所有指标都是越低越好。
公平性上,论文把所有方法都设为无深度监督。REArtGS++与ArtGS各优化30000次,而REArtGS在第一阶段还需额外30000次;这意味着REArtGS++的结果不是靠更多迭代换来的,至少在论文设定里,它同时改善了误差与优化时间。
10 两部件对象:表面更稳,但不要只看一个总分
在PARIS合成对象上,REArtGS++的平均CD-w为3.25,REArtGS为4.49,对应27.6%的整体表面误差下降;平均轴角、轴心和部件运动误差分别为0.01°、0.45 mm和0.01。
图4|PARIS对象的起始/结束状态重建。上半部分比较关节建模与部件运动,下半部分比较表面网格;REArtGS++在多类对象上减少了动态部件的缺口和形变。来源:论文Figure 4。
真实PARIS对象更复杂,优势并非每个单项都碾压。两件真实对象的平均CD-w为6.08,REArtGS为7.21,ArtGS为15.52;但平均轴心误差42.66 mm,与ArtGS的42.83 mm接近。这提醒我们,表面重建改善不等于所有关节参数都已经达到机械测量级精度。
论文最扎实的结论是“整体路线更稳”,而不是“每个对象、每个指标都第一”。例如合成对象某些静态或动态表面子项仍有其他方法更低,真正拉开差距的是平均表现、复杂关节鲁棒性与中间状态几何一起改善。
11 多部件与螺旋关节:无类型先验的价值终于显出来
ArtGS-Multi上,REArtGS++对5个多部件对象的平均Axis Ang、Axis Pos与Part Motion分别为0.55°、0.50 mm、0.22。ArtGS对应25.08°、96.49 mm、9.41,REArtGS对应49.43°、230.31 mm、28.07;差距最大的正是旧方法先验容易判断错的多关节对象。
两个新增螺旋对象上,REArtGS++平均轴角误差0.07°、轴心误差2.54 mm,Part Motion的平移与旋转误差为0.01米与0.23°。ArtGS的轴角均值64.93°,REArtGS为67.13°;这个数量级差异说明纯旋转/纯平移的离散先验一旦套到螺旋结构上,后续优化很难自行救回来。
图5|螺旋关节对象的动态重建。螺旋运动同时含旋转与沿轴平移,旧方法用单一类型先验时会出现明显运动或表面偏差;REArtGS++用统一解耦参数表达两种分量。来源:论文Figure 5。
Figure 3与Figure 5共同说明:“不预判类型”是在避免让错误离散决策成为整条几何链的不可逆起点。真实柜门、瓶盖、旋钮和滑轨的运动并不总是严格服从单一关节。
12 消融实验:哪块拿掉,系统会怎样坏
完整模型在多部件与螺旋对象综合消融上的Axis Ang、Axis Pos、Part Motion和CD-w为0.41°、1.18 mm、0.22、2.13。去掉平面Gaussian后变为5.18°、21.38 mm、6.23、6.45;改回双四元数运动后,轴角误差升到22.78°,说明显式解耦轴心、旋转和平移是复杂关节的核心。
去掉时间几何损失Lgeo后,四项变成4.04°、16.08 mm、4.73、5.06;只去掉法线时间梯度,仍退化到3.61°、9.52 mm、3.04、4.41。若不用canonical state,而随机选另一个时间点做差分,结果更差到5.83°、23.10 mm、6.24、6.34,支持论文关于“随机状态会引入额外运动误差”的解释。
图6|局部投票与几何正则的定性消融。去掉投票后,部件边界出现噪声和不完整分配;去掉几何正则后,高亮区域的柜体表面明显退化。该图说明组件如何影响结果,数值幅度需结合消融表。来源:论文Figure 6。
去掉局部投票时,Axis Pos从1.18 mm升到15.10 mm,CD-w从2.13升到3.07,Figure 6也能看到边界分割变脏。更值得注意的是,随机初始化让动态表面CD-m升到126.03,去掉相对距离或MLP也会造成大幅退化;这套方法的强项来自完整优化闭环,不是只靠一个漂亮公式。
13 真实物体能做到哪一步
论文还展示了5个真实对象:其中2个来自PARIS,另外3个是日常环境中采集的复杂对象。Figure 7同时给出起始与结束状态的部件级表面,说明方法不只在合成CAD模型上工作,也能在真实纹理、视角变化与多部件结构下形成可分离网格。
图7|真实物体在起始与结束状态的部件级表面重建。颜色区分不同部件,可观察到门板、抽屉或连接结构的分离与运动;图像支持真实场景可行性,但样本数量仍有限。来源:论文Figure 7。
论文没有用大规模真实类别库证明“任意未知物体都稳定”,也没有展示机器人闭环抓取成功率。现有证据只说明重建链可迁移到少量真实对象,不等于感知、规划、控制全栈已经打通。
14 效率与落地:16—20分钟很快,但采集仍然不轻
单张RTX 4090上,REArtGS++每个对象平均优化约16—20分钟,与ArtGS相当,明显快于REArtGS约70分钟。原因之一是它没有单独训练静态SDF阶段,而是让平面Gaussian直接提供法线与深度,并用canonical差分近似时间梯度。
但“两个状态”不能误读成“两张图”。每个状态仍需60—100张有位姿RGB图像,且两状态位姿要对齐;这适合离线资产生成,对移动机器人现场即拍即用仍偏重。
从产品角度看,它更像一个高质量对象资产生成器,而不是开箱即用的实时操作感知模块。近期最现实的落点是离线建立可动资产、仿真场景和操作先验,再把网格与关节参数交给规划器;真正在线化,还要解决少视角、自动位姿、遮挡和增量更新。
15 局限集中看:漂亮结果背后的四条边界
第一,透明材质仍是明确短板。透明门板、玻璃容器会让颜色、深度与表面对应关系变得不可靠,平面Gaussian和法线一致性无法凭空恢复缺失光学信息;论文把透明表面建模列为后续方向。
第二,两状态相机位姿必须对齐。若坐标系本身存在偏差,系统可能把相机误差解释为部件运动;作者计划未来联合优化两状态位姿,这也说明当前流程仍依赖较可靠的外部位姿估计。
第三,连续时间约束是一阶近似。它用端点和canonical state构造法线变化率,计算高效,但对大幅非线性形变、非刚体运动、碰撞接触或中途改变运动模式的对象,没有直接观测保证。
第四,真实规模与任务闭环仍有限。真实对象数量不大,实验假设物体可由若干刚性部件与关节描述;强遮挡、动态背景、手持模糊、未知部件数,以及重建误差对机器人抓取成功率的影响,都需要更系统验证。
16 龙哥点评:这篇论文真正值得带走的三件事
第一,把不可逆的离散判断尽量推迟。旧路线先判断关节类型,再优化参数;REArtGS++让统一连续参数自己退化到旋转、平移或螺旋。很多视觉系统的失败并非后端不够强,而是入口处过早做了一个错误分类,之后所有模块都只能在错误前提下精修。
第二,端点正确不代表过程正确。时间几何约束最有启发的地方,是它把“中间会不会坏”变成可优化量。这个思想可以延伸到动态重建、视频生成、机器人轨迹和可编辑3D资产:只比较起点与终点,往往会漏掉系统真正使用时经过的那条路。
第三,工程价值来自约束闭环,而不是榜单第一。平面表示、软分割、解耦运动、时间正则、局部投票与初始化各守一环,组合起来才把误差链截住。
这篇论文适合学习“如何把表示设计与可监督量对齐”:先问模型缺什么几何,再设计能被渲染、比较和反传的中间变量。机器人和数字孪生团队则应先核算多视角采集、位姿标定与逐对象优化成本,而不是只看0.07°。
17 龙迷三问
如果把每个状态60—100张图压到十几张,哪一环会先崩?是部件概率不稳、轴心漂移,还是平面Gaussian的法线与深度先失真?这个问题决定它能否从离线扫描走向现场感知。
如果把相机位姿也纳入联合优化,怎样避免“相机动了”和“部件动了”互相冒充?两种运动都能改变像素投影,需要更强的静态区域、跨状态对应或物理先验来打破歧义。
如果最终目标是机器人操作,评价是否应从几何误差继续走向任务成功率?Chamfer Distance和轴误差很重要,但规划器真正关心的是门能否顺利打开、轨迹是否碰撞、关节限位是否可信。把几何指标与操作闭环接起来,可能是这条路线下一步更有价值的验证。
总结
REArtGS++把两状态关节物体重建从“先猜类型、再拟合端点”,推进到“统一运动、联合分割、约束整段几何”。在PARIS、多部件、螺旋关节和少量真实对象上的结果说明,这条组合路线确实比ArtGS与REArtGS更稳,尤其能避免错误关节先验造成的灾难性偏差。
龙哥认为,它最值得记住的不是某个最小误差,而是一个系统设计原则:让表示直接产出可核验的几何量,让连续参数吸收不确定类型,再用跨时间与局部空间约束阻止模型走捷径。当这三件事连成闭环,3DGS才从“快速渲染表示”更进一步,变成能够承载可动结构与物理操作语义的对象模型。
主要来源
REArtGS++官方全文(arXiv v3)
https://arxiv.org/html/2511.17059v3
ArtGS官方记录
https://arxiv.org/abs/2502.19459v2
REArtGS官方记录
https://arxiv.org/abs/2503.06677v5
本文依据论文公开版本、图表与实验设置整理,指标含义和适用范围以原文为准。
本文仅代表个人理解,不构成对论文结论的替代审核。建议对关键数字、实现细节和后续版本继续阅读原论文核对。