← 返回 PaperDaily 视觉与图像

稀疏视角3DGS:HeroGS三层纠偏,用约1/5高斯稳步提分

论文基本信息 原文标题: HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views 首次公开: 2026 年 3 月 1 日 当前版本: v2,2026 年 3 月 3 日 机构: 中国科学院大学 原论文: https://arxiv.org/abs/2

稀疏视角3DGS:HeroGS三层纠偏,用约1/5高斯稳步提分

论文基本信息

原文标题:HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views
首次公开:2026 年 3 月 1 日
当前版本:v2,2026 年 3 月 3 日
机构:中国科学院大学
原论文:https://arxiv.org/abs/2603.01099

龙哥导读

稀疏视角3DGS最怕的不是“点少”,而是少量照片把高斯带到错误位置后,模型继续用更多高斯掩盖错误。HeroGS沿图像、特征、参数三层逐级纠偏:在LLFF训练动态示例中,它用约五分之一的高斯,PSNR仍持续上升并全程高于FSGS。

先看最反常识的一组结果:在论文给出的LLFF训练动态示例里,HeroGS的PSNR从5k迭代时的21.03持续升到20k时的21.29;FSGS在12.5k达到20.54后,反而回落到20.47。

Figure 6左侧HeroGS与FSGS训练PSNR曲线

首屏证据|蓝线HeroGS在六个采样点持续上升,黄线FSGS后半程回落;20k时两者相差0.82 dB。该结论仅对应论文展示的LLFF训练动态。来源:论文Figure 6。

Figure 6右侧HeroGS与FSGS高斯数量柱状图

同一示例中,HeroGS主表示约11万—13万个高斯,FSGS约53万—58万个。原图没有柱顶精确值,因此这里只写目测区间与“约1/5”,不外推为完整训练成本下降。来源:论文Figure 6。

龙哥看稀疏视角重建,最关心的从来不是模型能不能在三张图上“凑出一张新图”,而是它有没有把缺失信息变成可控误差。照片一少,背景没有梯度、边缘只被看见一次、遮挡区域甚至完全没有可靠颜色,3DGS很容易把一个错误椭球复制成一片看似丰富的纹理。

HeroGS最有价值的进步,是不再把“增加监督、补边缘、删错点”揉成一个正则项,而是按全局到局部的顺序,把三类问题交给三层指导。先用插帧补足视角,再按边缘和区域密度重新分配高斯,最后让三个Gaussian场互相校验,错误才不容易一路传到底。

Figure 4中原始3DGS在三个LLFF场景的结果

图1a|Figure 4移动端裁图之一。单列是原始3DGS,三行从上到下是fern、fortress、trex场景;黄色框标出远处背景、雕塑纹理与恐龙骨架等局部。这里没有坐标轴和定量数字,展示的是三视角训练下的定性外观。来源:论文Figure 4。

Figure 4中DRGS和FSGS在三个LLFF场景的结果

图1b|中间两列依次是DRGS与FSGS,仍按fern、fortress、trex三行排列。DRGS偏平滑,FSGS恢复了更完整的大轮廓,但黄色局部框里仍能看到远景模糊、细纹理黏连或边缘不够稳定。来源:论文Figure 4。

Figure 4中HeroGS在三个LLFF场景的结果

图1c|右列是HeroGS,同样对应三个场景。叶片与远处结构更清楚,雕塑和恐龙骨架的局部纹理更连贯;但这张图只能说明所展示视角中的伪影减少,不能单独证明所有场景、所有视角都优于基线,仍需结合表格指标。来源:论文Figure 4。

这三张移动端裁图先把问题说透了:3DGS的失败不是统一变糊,而是不同区域以不同方式失真。背景可能因为高斯覆盖不足而空、边缘可能因为位置偏移而重影、纹理密集区域又可能堆入过多形状错误的高斯。

所以,单纯“多生成一些点”并不等于补几何。真正需要控制的是:哪里该补、哪里该减、哪些点即使能降低训练误差也不该留下。HeroGS的三层结构,正是围绕这三个判断展开。

01 稀疏视角为什么会把3DGS带偏

标准3DGS从SfM点云和相机位姿出发,把场景表示成大量带位置、尺度、旋转、颜色与不透明度的三维高斯。训练视角足够多时,同一个表面会从不同方向接受梯度,错误高斯很难同时骗过所有照片;视角很少时,一个漂在空间里的高斯可能只需迎合一两张训练图,就能长期存活。

论文把失衡概括成三类。第一是全局覆盖不足,尤其是远处背景和训练相机看得少的区域;第二是高频结构失真,树叶、骨架、细杆和雕塑纹理需要更精确的位置与形状;第三是局部过密,模型为了记住训练图,在同质区域堆出许多冗余高斯。

这也是稀疏视角任务的根本矛盾:要增加容量,才能填上没被充分观察的空间;又要限制容量,防止模型记住几张照片。HeroGS没有选择“一律增密”或“一律正则”,而是先补监督,再按区域调容量,最后按跨场一致性清理参数。

02 FSGS与CoR-GS已经做了什么,HeroGS又补了哪一环

FSGS是HeroGS直接建立其上的实现基线。它通过Gaussian unpooling更快扩充稀疏SfM点,并利用深度引导的伪视角约束训练,解决“起点太稀、监督太少”的问题;这条路线能较早恢复主体结构,但区域之间的高斯分配仍可能不均,伪监督里的局部误差也可能被模型吸收。

CoR-GS从另一个方向处理过拟合:同时训练两个Gaussian场,利用点位置和渲染差异做协同剪枝与伪视角正则。它的重要启发是,两个独立优化的场如果都在相近位置放置高斯,这些点更可能对应稳定几何;若只在一个场里出现,就值得怀疑。

HeroGS吸收了两条路线,但没有停在“更多伪视角”或“双场互检”。它把FSGS提供的主体框架扩展成图像层伪密集监督,把区域内该放多少高斯交给FADP,再把CoR-GS式一致性扩展为一个主场加两个辅助场,并加入冻结后的单向剪枝。

FSGS主要回答“怎样从少量输入尽快长出场景”,CoR-GS主要回答“怎样用多场分歧识别可疑点”;HeroGS补上的,是从生成监督、分配容量到稳定几何的连续闭环。这不是把三个模块并排摆放,而是让上一层输出成为下一层更可靠的起点。

03 Figure 2总览:三层不是并联,而是逐层收口

Figure 2顶部从左到右画出主线:SfM点初始化灰色高斯;图像层让分布更完整;特征层在需要细节的位置增加高斯、在冗余区域减少高斯;参数层再删掉跨Gaussian场不一致的点,得到更紧凑的绿色结果。两条虚线表示层间还有反馈:图像层形成的patch统计进入特征层,特征层形成的更细结构又为参数层提供更可靠的匹配基础。

HeroGS的顺序是先扩大可见性,再重新配置表达资源,最后用独立优化轨迹做几何投票。每层都不完美,但后一层专门处理前一层最容易留下的副作用。

04 图像层:把两张真实照片之间补成“伪密集监督”

图像层先取相邻训练图,使用视频插帧模型VFI生成中间RGB图像。对应的虚拟相机也放在两台真实相机之间:旋转使用球面线性插值,平移使用线性插值;论文实验设置S=4,因此每对相邻训练视角之间插入3个生成视角。

Figure 2图像层的插帧视角与监督损失

图3|Figure 2图像层移动端裁图。左侧由Sparse Views经VFI得到Interpolated Views;右上损失比较生成图与渲染图的L1、D-SSIM,并加入深度相关约束;右下蓝色相机是真实训练视角GT,黄色虚线相机是中间视角IV。来源:论文Figure 2。

训练时,模型从这些中间相机渲染RGB与深度。RGB用L1和D-SSIM对齐插帧图,深度不要求绝对值逐像素相等,而是用Pearson相关性约束结构趋势;这与FSGS的几何监督思路相接,目标是让新增视角提供更多可传播的梯度。

论文也明确承认,二维插帧模型没有三维意识,生成图与插值得到的相机位姿可能不完全匹配。HeroGS把中间相机位姿设成可学习变量,与Gaussian场一起优化,并设置选择模块:先训练2000次,再根据伪标签与当前渲染的差异筛选质量较高的一半,之后动态重选。

图像层的作用不是把生成图当真值,而是用更多近邻观察方向扩大梯度覆盖,再通过可学习位姿和筛选降低错配影响。它提供的是“比三张照片更密”的监督,不是凭空补出可靠的新几何。

05 特征层:边缘要加点,空背景也要补,平坦区域反而要做减法

伪视角解决了“看得太少”,却不能保证鹿角、树叶、骨架这类高频结构被准确生成。FADP因此只使用真实训练图提取边缘,把边缘上的二维采样点反投影到三维,作为新Gaussian中心;新点的颜色、不透明度和形状由最近的3个已有高斯按距离加权初始化。

Figure 2特征层的投影统计与边缘提取

图4|Figure 2特征层移动端裁图。真实稀疏视角分成两路:Projector把三维高斯投到图像patch里统计密度,Edge Extraction提取高频轮廓;两路共同决定哪里增密、哪里抑制冗余。来源:论文Figure 2。

只有边缘增密还不够,因为它可能让局部越来越挤。论文把每张训练图划成8×8个patch,统计落入每块的投影高斯数:极稀区域至少补到最低覆盖,偏稀区域按λlow=2.0增加,正常区域保持,过密区域按λhigh=0.8压低。

随后再做一次全局归一化,使调整前后的高斯总量基本一致。也就是说,FADP不是无上限加点,而是一次“容量搬家”:从纹理单一、已经过密的区域拿走预算,放到背景缺口与高频边缘。

这一层最值得借鉴的不是边缘检测本身,而是把“哪里难”与“模型容量放哪里”直接连接。同样数量的高斯,平均撒开通常不是最优;稀疏视角下,容量分配比盲目扩容更关键。

06 参数层:让三个Gaussian场先互相质疑,再固定两把尺子

参数层CPG维护一个主Gaussian场和两个辅助场。训练前半段,三个场都独立接受真实视角与生成视角监督,并互相做协同剪枝;对源场中的每个高斯,在目标场寻找最近邻,空间距离超过阈值的点会被视为不一致候选。

Figure 2参数层的多场训练冻结与协同剪枝

图5|Figure 2参数层移动端裁图。右上示意早期三个场周期训练并互相排除不一致点;右下示意冻结后辅助场成为参照,主场继续更新与剪枝;左侧展示三维点分布和最终输出。火焰、锁与雪花是状态示意,不对应真实温度。来源:论文Figure 2。

训练到预设的10k迭代后,两个辅助场均固定尺度与旋转参数,让它们停在不同局部解;主场继续更新,但剪枝从三方互相作用变成辅助场对主场的单向校验。

为什么冻结反而有用?如果三个场一直同步变化,它们可能一起迁就伪标签里的错误;冻结后,两条不再追着主场跑的轨迹像两把尺子,主场新增或移动的高斯必须同时经得住参照。论文Table 4中,去掉Post-Freeze后LLFF三视角PSNR为21.16,完整设置为21.30,增幅不大,却与纹理稳定性的定性观察一致。

CPG不是用多数票证明某个高斯“绝对正确”,而是排除那些只在单条优化路径里成立的脆弱解。它把多场差异当作不确定性线索,再把这种线索转成实际剪枝动作。

根据论文方法整理的伪代码

输入:稀疏训练图、COLMAP相机与初始点云
初始化:主Gaussian场 + 两个辅助Gaussian场

先训练真实视角约2000次
在相邻真实视角间生成3个中间视角
筛选较可靠的伪标签,并联合优化中间相机位姿

训练过程中:
  用真实图 + 伪视角约束RGB与深度结构
  早期让三个场互相匹配并协同剪枝
  在8k按patch密度重新分配高斯预算
  在10k沿真实图边缘补点,并冻结辅助场部分参数
  后期只更新主场,用两个辅助场单向排除不一致高斯

输出:经过图像、特征、参数三层收口的主Gaussian场

决定性步骤是先后关系:伪视角从2k后阶段性加入,patch密度控制在8k执行,FADP与辅助场冻结在10k附近发生,总训练20k。如果把它简化成“插帧+边缘检测+三模型投票”,就会漏掉HeroGS真正的工程设计:不同干预在不同训练阶段接管不同错误。

07 再读首屏Figure 6:更稳到底意味着什么

Figure 6专门比较HeroGS与FSGS的训练动态。左图横轴是迭代次数,取5k、10k、12.5k、15k、17.5k与20k六个点,纵轴是PSNR;蓝色方块为HeroGS,黄色圆点为FSGS。

FSGS从5k的20.34升到12.5k的20.54,之后回落到20k的20.47,说明后半程继续优化并没有稳定换来更好测试视角。HeroGS则从21.03逐点升到21.29,没有在这六个采样点出现反向,20k时两者相差0.82 dB。

右图横轴只保留5k、10k、15k与20k四个迭代点,纵轴是Gaussian数量。蓝柱HeroGS约在11万—13万之间,黄柱FSGS约在53万—58万之间;按图上柱高估算,HeroGS大致只使用对方五分之一左右的高斯。

两张图合起来支持的,是“在该LLFF训练动态示例中,用明显更少的高斯取得更高且更平稳的PSNR”。它不等于所有场景都固定节省80%显存,也不等于端到端训练必然更快,因为HeroGS还维护两个辅助场、运行插帧与边缘处理。

08 再读Figure 4:三组场景分别暴露了什么

回到开头的Figure 4。它的列从左到右是3DGS、DRGS、FSGS、HeroGS,顶部又把它们分成Original Method、Regularization与Hierarchic Guide三类;行从上到下对应fern、fortress、trex,黄色框给出论文希望读者检查的局部。

第一行fern考验的是叶片和远处室内结构。3DGS出现大范围漂浮与拖影,DRGS把叶片与背景一起抹平,FSGS主体明显恢复,但远处小字与细结构仍模糊;HeroGS的背景分离和叶片轮廓更干净,符合图像层补覆盖、特征层照顾边缘的设计目标。

第二行fortress把镜头对准小型雕塑。黄色虚线框与放大框强调表面凹凸和颜色纹理:DRGS细节被平滑,FSGS保住整体形状但局部仍糊,HeroGS纹理更集中在物体表面,没有同样明显地向木桌背景扩散。

第三行trex最容易观察几何错位。3DGS与DRGS在骨架、楼梯和后方结构处混出重影,FSGS已能恢复恐龙主体,HeroGS在骨架间隙和斜向边缘上更清楚。这张图最能说明的不是“生成得更锐”,而是高频纹理更愿意待在正确的几何位置。

09 Figure 7:换到更大场景,HeroGS还补上了什么

Figure 7来自Tanks&Temples三视角实验,布局与Figure 4不同:列是四个大场景,从左到右可见室内大厅、户外雕像、小屋与纪念碑;行从上到下依次是3DGS、CoR-GS、FSGS、DropGaussian、HeroGS(图中写Ours)和Ground Truth。

Figure 7大厅场景六种方法逐行比较

图7a|大厅单场景裁图。六行依次为3DGS、CoR-GS、FSGS、DropGaussian、HeroGS、Ground Truth;可比较顶棚重复纹理、桌椅边缘与漂浮线条。该图没有坐标轴和数值。来源:论文Figure 7。

Figure 7雕像场景六种方法逐行比较

图7b|雕像单场景裁图,行顺序与图7a相同。主体轮廓、基座和远处植被用于观察前景—背景分离;HeroGS边缘更集中,但仍有模糊。来源:论文Figure 7。

Figure 7小屋场景六种方法逐行比较

图7c|小屋单场景裁图,六行方法顺序不变。墙面斜纹、屋顶、草地边界与红色栏杆在真值中更清楚,HeroGS仍未恢复全部细节。来源:论文Figure 7。

Figure 7纪念碑场景六种方法逐行比较

图7d|纪念碑单场景裁图,最下行是Ground Truth。碑体、顶部轮廓与天空边界可直接比较;完整HeroGS减少严重扭曲,但与真值仍有明显距离。来源:论文Figure 7。

大厅是典型高频重复纹理场景。3DGS出现密集漂浮线条,CoR-GS和FSGS恢复了空间主结构,DropGaussian减少部分冗余,HeroGS的桌椅与顶棚关系更接近最下方真值,但纹理仍被压平。

雕像场景考验主体与远处植被的分离。几种正则方法都能保住主体轮廓,但背景或基座仍有不同程度涂抹;HeroGS的边缘更集中,说明完整方法在Tanks&Temples大场景中也保留了定性优势。

小屋和纪念碑更能看到剩余差距。HeroGS仍有墙面斜纹、碑顶和天空边界不稳定的问题,最下方Ground Truth明显更清楚。Figure 7支持的是大尺度稀疏输入下伪影减轻与结构改善,不支持“已经恢复真实细节”这种更强结论。

定量上,Tanks&Temples三视角时HeroGS为17.51 PSNR、0.512 SSIM、0.422 LPIPS;六视角为24.70、0.781、0.272。它在两种设置下的PSNR和SSIM领先表中基线,但六视角LPIPS不如DropGaussian的0.215,说明“结构与像素指标更好”并不保证感知距离每项都最优。

10 表格里的进步:最稀疏时收益最大,但不是每项都赢

LLFF两视角是论文提升最明显的设置。HeroGS达到18.78 PSNR、0.595 SSIM、0.317 LPIPS;FSGS为15.65、0.460、0.412,CoR-GS为17.38、0.539、0.350。相对直接基线FSGS,PSNR增加3.13 dB,SSIM提高0.135,LPIPS降低0.095,三个方向一致。

三视角时,HeroGS为21.30、0.739、0.189,FSGS为20.43、0.682、0.248,CoR-GS为20.45、0.712、0.196,DropGaussian为20.55、0.710、0.200。优势仍在,但从“救活极稀输入”转成更温和的纹理与结构改进。

六视角时,HeroGS的24.59 PSNR与0.837 SSIM仍是表中最高,但LPIPS为0.135,弱于DropGaussian的0.117和FSGS的0.128。这组结果说明HeroGS的强项更偏向结构一致性和像素重建,不能把“多指标总体领先”写成“所有指标全面第一”。

两视角结果还有一个必须说明的实验边界:FSGS依赖COLMAP多视图立体,在8个LLFF场景中的3个场景失败,因此论文只在剩余5个场景上平均,并随机选择两张训练图。这个设定能公平比较同一初始化条件下的方法,却不能证明HeroGS已经解决极少视角时的相机位姿或SfM失败。

11 消融真正证明了“三层互相放大”吗

从FSGS基线逐步加模块,LLFF两视角PSNR依次为15.65、加入VFI后的16.91、加入FADP后的17.28、加入单辅助场冻结尺度后的17.93,完整HeroGS达到18.78。可以看到,单独补伪视角已经带来1.26 dB,后续特征和参数层继续累积收益。

Table 6进一步把三层拆开组合。单层平均为16.78 PSNR、0.502 SSIM、0.393 LPIPS;任意两层平均提升到17.68、0.540、0.359;三层一起达到18.78、0.595、0.317。论文据此认为层之间存在协同,而不是三个独立插件简单相加。

这个解释在机制上是通的:图像层补出的覆盖让patch密度统计更有意义,FADP整理过的分布让跨场最近邻更可靠,CPG又把伪标签引入的局部错位剪掉。层级协同最可信的证据,是完整组合同时改善PSNR、SSIM和LPIPS,并且定性图里的错误类型正好对应各层目标。

12 局限集中看:它解决了分布失衡,还没有解决所有稀疏输入

第一,输入仍依赖可用的相机位姿与SfM初始化。论文使用COLMAP预计算相机和点云,两视角时还有3个LLFF场景因多视图立体失败而未纳入平均。因此HeroGS更像“在初始化可用时,把稀疏监督用得更好”,而不是从任意两张照片直接完成稳健重建。

第二,伪标签带来新的偏差来源。插帧模型缺少三维意识,可学习位姿和动态筛选能缓解图像—相机不一致,却不能保证遮挡、新显露区域和细杆结构真实;以当前渲染作为筛选参照,也可能形成“模型更喜欢与自己相似的伪标签”这一反馈。

第三,特征层目前只执行一次。论文说明单次FADP已恢复大部分高频细节,多次执行只有边际收益,未来才考虑多阶段自适应反馈。这意味着图像层、特征层与参数层虽然有层级联系,还不是持续往返的闭环优化。

第四,训练紧凑性与部署效率要分开判断。Figure 6证明最终训练过程中的主表示高斯更少,论文据此讨论内存与渲染潜力;但完整训练还包括VFI、边缘提取、三个Gaussian场和周期剪枝,没有专门的端到端耗时与峰值资源表,就不宜直接写成“训练成本降到五分之一”。

HeroGS把“少视角导致高斯分布失衡”处理得更系统,但相机失败、生成先验偏差、训练额外开销和极端遮挡仍在边界之外。这些不是否定结果,而是决定它适合被复现到哪一步。

13 龙哥点评:稀疏重建下一步,可能不是更会“生点”,而是更会管理点

龙哥最认可的,不是HeroGS又刷新了一个稀疏视角表格,而是它把3DGS里长期被当成实现细节的“高斯分布管理”抬到了方法主线。照片少时,模型容量不是越大越安全;错误容量会把错误几何固化得更漂亮、更难发现。

对研究者,这篇论文给出一个可迁移的设计模板:先用额外观察扩大监督域,再用任务相关特征重新分配容量,最后让多个独立解暴露不确定性。这个模板不只适用于3DGS,也适合任何“显式基元很多、局部梯度不足、容易靠容量记忆训练样本”的系统。

对工程团队,更现实的问题是收益出现在哪里。若目标是少量有位姿照片的快速场景资产,HeroGS的最终主场更紧凑,值得关注;若系统瓶颈在相机估计、无序照片、动态物体或在线增量重建,这篇工作没有直接给出答案,接入前仍要补完整链路。

龙哥的判断是:HeroGS真正推进的,是从“用更多高斯拟合稀疏照片”转向“用层级证据决定每个高斯该不该出现、该出现在哪里”。Figure 6里约五分之一的高斯只是结果,背后的方法论才更耐用——做减法之前,先让系统知道什么是冗余,什么是缺口,什么又是只在一条优化路径里成立的幻觉。

主要来源

HeroGS官方论文HTML(v2)
https://arxiv.org/html/2603.01099v2

FSGS官方论文页
https://arxiv.org/abs/2312.00451

CoR-GS官方论文页
https://arxiv.org/abs/2405.12110

本文依据论文公开版本、Figure 2、4、6、7与实验表格整理;目测区间、定性差异和适用范围均按图中可见内容谨慎表述。

本文仅代表个人理解,不构成对论文结论的替代审核。建议对关键数字、训练设置和后续版本继续阅读原论文核对。

end

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球