← 返回 PaperDaily 视觉与图像

最新研究:从84秒到0.05秒,独立研究者让VBGS实时重建提速1680倍

3D高斯泼溅做持续重建,最大痛点就是慢。这篇论文用空间截断变分推断加改进重分配,把每帧训练延迟从84秒干到0.05秒,1680倍提速还不掉质量,直接在RTX 3070 Ti上跑通。做机器人实时建图的读者,这篇相当值得看。

最新研究:从84秒到0.05秒,独立研究者让VBGS实时重建提速1680倍
原论文信息如下:
论文标题:
ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting
发表日期:
2026年07月
发表单位:
Independent Researcher(独立研究者)
原文链接:
https://arxiv.org/pdf/2607.15542v1.pdf

引言

3D高斯泼溅(3DGS)已成为高质量新视角合成与在线建图的主流方法。它将场景表达为大量3D高斯分布,通过可微光栅化优化参数。但其离线批次优化假设所有图像一次性给定,在持续学习场景中,新数据会覆盖旧参数,引发灾难性遗忘。常见对策是维护回放缓冲区,但内存和计算开销随观测帧数线性增长,资源受限设备难以承受。
2024年的Variational Bayes Gaussian Splatting(VBGS)另辟蹊径:将场景建模为概率混合模型,用坐标上升变分推断(CAVI)推导闭式更新规则。由于更新仅依赖累积充分统计量,天然免疫灾难性遗忘,无需回放缓冲区。然而,原始VBGS实现极慢:在NeRF Synthetic数据集上每帧训练平均需84秒,完全无法实时。后续改进虽将显存从9.44GB压至1.1GB,训练总时长从234分钟缩至61分钟,但每帧延迟仍高,离实时差距甚远。
本篇ImprovedVBGS正是冲着“实时”缺口而来。作者将每帧平均延迟从84.0秒直接拉到0.050秒,实现1680倍加速,且重建质量基本不掉。这一切在RTX 3070 Ti(8GB显存)上完成,将持续学习3D重建推到了实用化门口。

背景:从对抗遗忘到加速

理解ImprovedVBGS需先掌握三点:持续学习3DGS的痛点、VBGS模型本身、以及先行改进工作的边界。
持续学习3DGS主流方案分两类:局域优化(如CL-Splats)和生成式回放(如GaussianUpdate)。两者要么需存历史数据,要么需反复计算变化区域,存储和算力开销均高。
VBGS模型将3D场景视为概率混合模型,每个点包含可观测位置s和颜色c,由隐藏组件分配z控制。每个组件k对应多维高斯参数。先验选共轭的Normal-Inverse-Wishart和Dirichlet,使变分更新成为闭式解。新数据只需累加统计量,遗忘问题被“设计”掉。代价是每次更新需评估所有点对K个组件的责任度,复杂度O(nK),参数也比传统3DGS多一倍。
先行改进(文献[11])通过核融合和自动混合精度搜索,将训练总时长从234分钟降至61分钟,显存从9.44GB降至1.1GB,并在Jetson Orin Nano上跑通。但这版仍处理所有已观测点,单帧延迟依然高。
ImprovedVBGS在此基线上再加速,复现核融合和混合精度搜索作为基线,加入两个关键创新:空间截断变分E步改进的重分配机制

方法概述

ImprovedVBGS的整体思路:与其在全量候选上精确计算,不如在空间局部邻域里近似,且质量损失微乎其微。
方法由三个核心模块构成:
第一,沿用核融合与自动混合精度搜索作为地板优化。有趣的是,一旦空间截断E步生效,混合精度对性能几乎无正向帮助。
第二,空间截断变分E步是提速主力。变分推断核心是ELBO最大化,E步需为每个点计算对K个组件的责任度。观察发现空间似然质量高度集中在邻近均值附近,因此给每个点只找C个最近邻组件计算责任度。论文用KD树做近邻搜索,复杂度从O(nK)降至O(nC)。
第三,改进的重分配机制。持续学习中,新数据可能出现在未覆盖区域,需将不常用组件搬迁到模型覆盖不到的地方。具体做法是看Dirichlet后验参数α_k,将α_k最低的5%组件移到当前批次ELBO最低的点附近。原始VBGS重分配需重算全量ELBO,开销巨大。ImprovedVBGS发现ELBO在E步中已算过,直接复用即可,还通过调整运行顺序转发ELBO值,并消除JAX动态形状重编译开销。

从84秒到0.05秒:VBGS实时化的关键突破

VBGS用坐标上升变分推断替代反向传播,将场景建模为概率混合模型。由于变分更新闭式解只依赖累积充分统计量,天然免疫灾难性遗忘。但每次变分E步需评估每个数据点在所有K个组件下的责任度,复杂度O(nK)让训练速度随场景规模线性恶化。原始VBGS跑NeRF Synthetic数据集,每帧平均84秒,完全无法实时。
先行工作通过核融合和自动混合精度搜索,将训练总时长从234分钟降到61分钟,显存从9.44GB压到1.1GB。但仍需遍历全部已观测点,单帧延迟离实时差着量级。ImprovedVBGS用两把“手术刀”切掉最后瓶颈:空间截断变分E步和重分配优化。
这套加速在RTX 3070 Ti(8GB显存)上完成,比先行工作使用的A5000(24GB)门槛低不少。消费级显卡就能跑持续重建,部署受众扩大。
图2(a):基线VBGS(文献[10])加上融合统计量(文献[11])的延迟组成分析
图2(a):基线VBGS延迟组成。在Blender Lego场景、N=10⁵组件、fp64精度下,fit步中compute_elbo_delta占28.8秒/帧(47%),sum_stats_over_samples占24.3秒/帧(40%),其余仅8.1秒/帧。
图2(b):ImprovedVBGS的延迟组成分析
图2(b):ImprovedVBGS延迟组成。同样条件下,compute_elbo_delta降到3.1毫秒/帧(4.8%),sum_stats_over_samples降到3.7毫秒/帧(5.6%),其余占58.4毫秒/帧。量级变化一目了然。

空间截断E步:KD-tree如何让变分推断提速千倍

变分E步要为每个数据点x_n计算对每个组件k的责任度γ。责任度对数由空间似然、颜色似然和混合权重先验构成。
公式:ELBO_n = log Σ_k exp(log γ_n,k)
公式1:每个数据点的ELBO_n等于责任度对数的logsumexp。ELBO_n低意味着该点在所有组件下概率都低,正是需要放置新组件的位置。
当模型有大量组件时,为每个点遍历所有K个组件是热区中的热区。但空间似然的概率质量几乎完全集中在距离该点最近的几个均值附近。对每个点只取最近的C个组件计算,理论上不会造成多少信息损失。
空间截断E步具体做法:每帧进来,先在所有组件的空间均值上构建KD树,对每个数据点查询最近的C个组件索引,只在这C个候选上计算各项对数得分,随后softmax归一化得到软责任度,用logsumexp得到ELBO_n。复杂度从O(nK)降至O(nC)。在NeRF Synthetic实验中,C取4,K是10⁵——算力节约四个数量级,这就是28.8秒/帧变成3.1毫秒/帧的直接来源。
这个方法能work的原因:3D高斯的空间分布本质上是局部的,一个点几乎不可能被很远的组件“认领”。即便偶尔有远距离组件给出较大颜色似然,空间似然项也会强烈惩罚。截断近邻既能保住主要概率质量,又让计算量从“跟全场景规模走”变成“跟局部邻域大小走”。
有趣发现:一旦空间截断E步上线,自动混合精度搜索几乎不再带来额外性能收益。因为截断后E步不再是主导瓶颈,混合精度的优化空间自然缩小。这提醒后续研究者,计算瓶颈会“转移”,优化必须跟着瓶颈走。

重分配优化:消除动态编译与计算瓶颈

E步解决了训练主循环瓶颈,但另一个算力黑洞藏在重分配步骤中。
持续学习中,新数据会不断出现在模型未覆盖区域。重分配步骤把几乎没被用过的组件搬迁到建模最差的地方。判断标准是看每个组件k的Dirichlet后验参数α_k:如果某组件从没被分配到任何点,α_k会衰减到先验下限附近。每轮取α_k最低的5%组件,移到当前批次ELBO最低的点附近。
原始VBGS重分配代价非常大,因为要重新计算所有点对全量K组件的ELBO。消融实验显示,加上重分配后每帧延迟从0.050秒飙到18.1秒。如果不能低成本拿到ELBO,重分配反而成最大拖累。
ImprovedVBGS的重分配优化包含三个层次。第一层是截断重分配,直接复用E步已算好的ELBO。第二层是重分配转发,通过调整执行顺序从fit步转发ELBO值,省掉一次独立重算。第三层是静态张量填充,解决JAX动态形状触发重新编译的工程痛点:把重分配索引填充到最大数量n_max = ⌊f·N⌋,用静态形状消除编译开销。
从消融数据看,三层优化叠加后,重分配步骤耗时从18.1秒/帧降到0.107秒/帧。用“转发”换速度的代价是约0.2dB的PSNR轻微下降。

实验结果:质量保持与速度飞跃的完美平衡

先看关键消融实验。论文在NeRF Synthetic Lego场景上做逐步累加消融,完整揭示每项优化单独贡献的“速度-质量”账目。
表2:NeRF Synthetic Lego场景消融实验
表2:NeRF Synthetic Lego场景消融实验。基线VBGS每帧84.0秒、PSNR 20.65dB;加融合统计量降到41.0秒/帧;加截断E步降到3.39秒/帧(batch size 100);换250k大batch size后降到0.050秒/帧;重分配开启后回到18.1秒/帧;截断重分配降到0.373秒/帧;静态张量填充降到0.131秒/帧;加快转发降到0.107秒/帧,PSNR 21.37dB。
消融表信息量很大。第一,融合统计量单独能把延迟从84秒压到41秒,是纯粹“地板优化”。第二,截断E步贡献最猛,直接把延迟砍到3.39秒,PSNR几乎不变(20.64对20.65),说明截断近邻近似误差微乎其微。第三,大batch size是隐藏加速器:batch size从100提到250k,延迟从3.39秒降到0.050秒,67倍提升靠更好利用并行计算。
第四,重分配确实是“两头堵”:完全不做重分配,PSNR上不去;用原始全量重分配,延迟贵到离谱。截断重分配+静态张量填充+转发三板斧把重分配从“不可承受之重”变成“锦上添花”。唯一要斟酌的是转发选项:它把延迟从0.131秒降到0.107秒,但PSNR降低约0.2dB。实时应用中若每帧少0.02秒不重要,可关掉转发换更高质量。
再看NeRF Synthetic数据集全部8个场景表现。配置为N=10⁵个高斯组件,随机初始化,每个场景200帧训练。
表1:NeRF Synthetic数据集全场景结果(RTX 3070 Ti,随机初始化,静态形状重分配)
表1:NeRF Synthetic全场景结果(RTX 3070 Ti,随机初始化,静态形状重分配)。平均延迟0.133秒/帧,平均PSNR 21.42±0.74dB。
全部场景平均PSNR为21.42dB,与原始VBGS基本一致,但平均延迟仅0.133秒/帧,接近实时。个别场景如ship延迟略高(0.159秒/帧),hotdog的PSNR最好(23.40dB),materials方差最大(±1.41dB),但都没出现明显掉队。
定性结果上,论文提供全部8个场景的预测与真值对比。
图3(e):Lego场景定性结果,左为真值,右为ImprovedVBGS预测
图3(e):Lego场景定性结果。左为真值,右为ImprovedVBGS预测。经过200帧持续训练后,整体轮廓结构完整,颜色分布与真值高度一致,仅局部细节略显模糊。
图3(h):Ship场景定性结果,左为真值,右为ImprovedVBGS预测
图3(h):Ship场景定性结果。左为真值,右为ImprovedVBGS预测。该场景包含大量舰船、海面和复杂遮挡,模型依然能在200帧内完成较完整主体重建。
需要特别指出,融合统计量和混合精度搜索在截断E步之后不再产生明显收益。因为一旦E步不再是主导耗时项,混合精度省下的算力就无关紧要。最终版本优化配置非常简单——只需专注截断E步和重分配优化,底层算子优化维持基线水平。

局限与展望:实时持续重建的未来方向

ImprovedVBGS把VBGS的一只脚拉进“实时”门槛,但离大规模落地还有几个坎。
首先是深度输入依赖。与传统3DGS不同,VBGS训练需要深度图作为输入,实际机器人系统需深度相机或可靠深度估计模块。单目RGB场景下,VBGS框架不能直接使用。
其次是视图依赖颜色缺失。原始VBGS不使用球谐系数,视角变化带来的高光、反射等效果无法建模。在NeRF Synthetic物体级数据集上表现不严重,但放到含大量反光表面、复杂光照的室内外场景,画质可能明显跟不上传统3DGS。
再者是截断候选数C的鲁棒性。实验固定C=4,在八个物体场景表现良好,但真实建图场景空间分布更复杂。若场景拓扑特别复杂,或存在多个空间重叠但颜色差异巨大的物体区域,C=4解释力可能不够。最稳妥做法是让C自适应调节,或依据数据密度动态选择。
最后,250k的batch size对显存依然有要求。RTX 3070 Ti的8GB勉强跑通,换到更小显存边缘设备,batch size需下调,延迟也会上升。这方面还有压缩空间,比如分块处理或流式统计。
展望未来,有几个方向值得关注:把空间截断E步推广到室外大场景,处理更复杂几何拓扑;引入球谐建模视图依赖颜色,缩小与传统3DGS画质差距;探索在Jetson级别边缘设备上做进一步压缩,让持续重建真正走上机器人和无人机。ImprovedVBGS打开了一个重要思路——用空间局部性去破变分推断的计算瓶颈,这个思路在更大场景和更受限硬件上还有不少挖潜空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?ImprovedVBGS提出空间截断变分推断与改进重分配机制,将VBGS训练延迟从84秒/帧压缩至0.05秒/帧,保持重建质量不降,让消费级显卡也能跑实时持续3D重建。
这篇工作最值得看的点是什么?在NeRF Synthetic数据集上,平均PSNR达到21.42±0.74 dB,与原始VBGS相当;每帧延迟从84.0秒降至0.133秒(630倍加速),在Lego场景上达到0.050秒/帧(1680倍加速)
这篇工作的边界或风险在哪里?优点:(1) 实现了1680倍的加速,使VBGS从离线训练变为实时重建;(2) 保持无回放缓冲区的持续学习特性,从根本上避免灾难性遗忘;(3) 空间截断E-step在保持重建质量的同时大幅降低计算复杂度;(4) 静态张量填充避免了JAX动态重编译开销。缺点:(1) 需要深度输入,限制了应用场景;(2) 参数数量是传统3DGS的2倍以上(29 vs 14),内存占用仍较高;(3) 不支持球谐函数建模视角相关颜色;(4) 重分配转发以轻微PSNR下降为代价换取速度提升。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

通过空间截断变分E步(KD-tree最近邻剪枝)和截断ELBO重分配(含静态形状填充与重分配转发)实现VBGS的实时持续重建,避免回放缓冲区且保持重建质量。

实验合理度:★★★★☆

PSNR(峰值信噪比)、每帧延迟(秒/帧)

学术研究价值:★★★★☆

通过空间截断变分E步(KD-tree最近邻剪枝)和截断ELBO重分配(含静态形状填充与重分配转发)实现VBGS的实时持续重建,避免回放缓冲区且保持重建质量;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在RTX 3070 Ti上,平均每帧延迟从84.0秒降至0.050秒(1680倍加速);在NeRF Synthetic数据集上平均每帧0.133秒

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 需要深度输入,限制了应用场景;

主要参考文献

[1] Ackermann J, Kulhanek J, Cai S, et al. CL-Splats: Continual learning of Gaussian Splatting with local optimization. ICCV, 2025.
[2] Bishop C M. Pattern Recognition and Machine Learning. Springer, 2006.
[3] Blei D M, Kucukelbir A, McAuliffe J D. Variational inference: A review for statisticians. Journal of the American Statistical Association, 2017, 112(518): 859-877.
[4] Kerbl B, Kopanas G, Leimkühler T, et al. 3D Gaussian Splatting for real-time radiance field rendering. ACM Transactions on Graphics, 2023, 42(4).
[5] Mildenhall B, Srinivasan P P, Tancik M, et al. NeRF: Representing scenes as neural radiance fields for view synthesis. ECCV, 2020.
[6] Van de Maele T, Çatal O, Tschantz A, et al. Variational Bayes Gaussian Splatting. arXiv preprint arXiv:2410.03592, 2024.
[7] Zaino I, Risso M, Pagliari D J, et al. Improving continual learning for Gaussian Splatting based environments reconstruction on commercial off-the-shelf edge devices. arXiv preprint arXiv:2603.08499, 2026.
[8] Zeng L, Zhao B, Hu J, et al. GaussianUpdate: Continual 3D Gaussian Splatting update for changing environments. ICCV, 2025.

融会贯通

把ImprovedVBGS放进持续3DGS版图里看,它的位置很特殊。主流路线如CL-Splats和GaussianUpdate都建立在传统3DGS基础上,靠局部优化或生成式回放缓解灾难性遗忘,本质是“边回忆边学”。VBGS则是换了一条路——从概率建模层面直接消除遗忘,ImprovedVBGS给这条路补上了速度短板。
结合PaperDaily已收录论文可观察到,NeRF Synthetic数据集上21.42dB的平均PSNR与原始VBGS报告结果基本一致,但当前库内暂时缺乏足够同基准数值对比,无法判断这一结果在全部公开方法中处于什么位置。需提醒读者,不同方法使用的数据集划分、深度输入来源和训练帧数可能存在差异,直接跨论文比较PSNR要非常谨慎。
这篇工作真正值得借鉴的,是空间截断这个工程思路:与其在所有候选上做精确计算,不如先花很小代价缩小候选集,再用近似计算大幅降低单次迭代开销。在3DGS以外的许多领域——比如大规模点云配准、神经场增量更新、多视图立体匹配——这个“先剪枝后计算”的原则都有迁移价值。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
从84秒到0.05秒,3D重建快到飞起🚀 想追实时重建、高斯泼溅、机器人感知前沿?扫码加入龙哥读论文粉丝群,和同行一起啃硬核论文!扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 3D重建+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。