← 返回 PaperDaily 视觉与图像

南方科技大学最新研究:室内占据预测告别体素分类,32个基元效果优于SOTA,速度3.7倍

室内占据预测,传统方法要么算得慢,要么基元浪费。南方科技大学这篇FLM-Occ,直接把问题换个角度定义——从分类变成估计分布,用最大似然训练。结果呢?只用32个基元,精度超越SplatSSC的1200个,速度还快了快4倍!这思路,有点东西。

南方科技大学最新研究:室内占据预测告别体素分类,32个基元效果优于SOTA,速度3.7倍
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
室内占据预测,传统方法要么算得慢,要么基元浪费。南方科技大学这篇FLM-Occ,直接把问题换个角度定义——从分类变成估计分布,用最大似然训练。结果呢?只用32个基元,精度超越SplatSSC的1200个,速度还快了快4倍!这思路,有点东西。


原论文信息如下:
论文标题:
FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction
发表日期:
2026年06月
发表单位:
南方科技大学
原文链接:
https://arxiv.org/pdf/2606.21373v1.pdf
项目链接:
https://gcchen97.github.io/flm-occ/
室内占据预测,就是给一张单目RGB图,让算法猜出房间里哪些地方有东西、是啥(墙、椅子等)。传统体素分类法把空间切成小方块逐个判断,计算量随体积立方级增长。近两年大家改用混合模型(如高斯体、超二次曲面),每个基元覆盖多个体素,算得快。但训练用体素分类损失,导致很多基元赖在空白区域不走,成了“占着茅坑不拉屎”。
FLM-Occ把问题从分类变成分布估计,用最大似然训练,让所有基元都去“解释”整个场景。
插图
视频:场景scene0024_00对比,上方SplatSSC(1200个高斯体),下方FLM-Occ(仅32个超二次曲面)。FLM-Occ基元更稀疏,几何边界更清晰,几乎没有冗余基元。

痛点揭秘:为何传统方法会在空区域“虚占茅坑”?

以GaussianFormer、SplatSSC等方法为例,它们初始化一堆基元,根据图像特征调整位置形状,再体素化后用体素分类损失监督。问题在于:当一个占据体素已被某些基元覆盖,其他远离的基元几乎收不到梯度信号。这些“空基元”接收不到“搬家”指令,就成了计算冗余。
图2:四种基于高斯的占据预测方法对比。
图2:GaussianFormer、GaussianFormer-2和SplatSSC都在空白区域留下大量冗余基元,而FLM-Occ通过MLE训练将基元精确迁移到占据区域。
论文Fig. 3左边(a)展示了体素分类损失下,远离占据区域的基元收不到有效梯度,无法挪动。右边(b)是MLE,占据体元的梯度可传递到所有基元,给远距离基元明确的“搬家”指示。
图3:体素分类损失(a)与MLE(b)下单个基元训练损失的信息流对比图。
图3:MLE下占据体元的梯度可传递到所有基元,即使离得很远。

破局之法:基于最大似然估计的FLM损失函数

FLM的核心:将占据预测重新定义为体素分布估计问题。用最大似然估计,找到一组基元参数,使所有真实占据体素出现的联合概率最大。模型全局上让所有基元尽力“解释”整个场景。
FLM损失由两项构成:体积项惩罚基元总体积,压缩其贴合占据区域;密度项要求每个占据体素处密度尽可能大,将基元拉过去。两项共同作用,解决“虚占茅坑”。
图4:FLM损失中两项作用的2D示意图。体积项压缩基元以匹配体素形状,密度项则将基元拉向体素位置。
图4:左侧初始基元均匀分布,经FLM训练后(右侧),体积项压缩形状,密度项拉到占据体素(红点)附近。
每个占据体素能为所有基元提供有效梯度,远距离基元也能收到“搬家指示”,实现端到端全局优化。

巧妙的实现:归一化体积与端到端训练的难题破解

实现有两个坑:
插图
视频:场景scene0032_00对比,SplatSSC(上) vs FLM-Occ(下)。FLM-Occ基元可从均匀分布位置长距离“瞬移”到沙发、床上。

坑一:混合权重的单纯性约束

标准混合模型里,每个基元权重加和为1。论文解法:将混合权重定义成归一化的基元体积。每个基元体积vj,权重wj=vj/∑vk,自动满足约束,且大基元权重更高,逻辑自洽。

坑二:新的体素化公式

FLM的MLE范式下,论文推导了基于密度的体素化公式:某体素x的占据概率是所有基元在该点密度贡献之和;语义分数是该类别下所有基元贡献的和。
FLM-Occ架构精简:输入RGB图,用Depth Anything v2提取特征,通过4个残差精炼块,直接对均匀分布的初始基元进行移动变形,输出占据网格。损失只计算在占据区域上,计算量大降。
图5:FLM-Occ整体框架(左侧)及精炼块结构(右侧)。FLM-Occ通过图像特征引导,将初始化的基元逐步精炼为场景表示。
图5:FLM-Occ由图像编码器、初始可学习基元、四个残差精炼块和体素化模块组成,结构简洁。

实验结果:少即是多,32个基元即可超越SOTA

在Occ-ScanNet和Occ-ScanNet-mini2上评估,结果震撼。

主要量化结果(表2)

FLM-Occ在Occ-ScanNet上全面SOTA:
表2:在Occ-ScanNet数据集上的定量对比结果。
表2:FLM-Occ用1024个超二次曲面达64.0% mIoU,比SplatSSC(51.8%)提升12.2个百分点。仅用32个超二次曲面时,55.9% mIoU已超过SplatSSC(51.8%)和EmbodiedOcc(45.2%,16200个高斯体)。

精度-效率权衡(表4及图6)

FLM-Occ在精度-效率曲线上表现完美:
图6:精度与表示大小(基元数量)的关系。
图6:FLM-Occ用512个超二次曲面(IoU: 71.4%, mIoU: 63.6%, 26.2 FPS)显著优于SplatSSC(62.8% IoU, 51.8% mIoU, 8.7 FPS)。
基元移动距离统计:SplatSSC约0.15米,FLM-Occ约1.2米,说明其具备远程精确“搬迁”能力。

消融实验(表3)

消融实验表明,微调ViT(相对深度特征)提升极大(mIoU从43.9%到59.2%),密度正则化Lreg带来1-2%增益。
表3:不同网络配置下的性能对比消融实验。
表3:网络配置消融实验,微调ViT和密度正则化均有效。

可视化对比(图8)

FLM-Occ基元分布紧凑稀疏,体素边界清晰锐利。
图8:在Occ-ScanNet数据集上的定性对比结果。
图8:SplatSSC在空区域有大量噪声,FLM-Occ(32或1024基元)几乎没有冗余,预测更干净精确。

总结与展望:道路宽敞,未来可期

FLM-Occ提出新训练范式,将分类转为分布估计,配合MLE损失实现基元精准远程部署。这是对问题定义层的革新。后续可融合时序信息、扩展到动态场景或更细粒度语义标签。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

FLM损失到底跟普通的体素分类损失有什么区别?体素分类损失只看局部,当体素被覆盖好时其他基元收不到梯度。FLM损失最大化所有占据体素的联合概率,每个占据体素影响所有基元,具有全局视野,引导基元长距离移动。

超二次曲面(Superquadric)和高斯体(Gaussian)有什么区别?高斯体形状固定(椭球),超二次曲面通过形状参数可模拟长方体、圆柱等多样形状。基元少时超二次曲面更优,高斯体随数量增加效果逼近。

这个方法可以应用到自动驾驶场景吗?论文针对室内场景,但FLM核心思想通用。自动驾驶场景更大、物体更远,FLM-Occ的远程移动能力契合需求,需适配视角和语义类别,是很有潜力的方向。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

从分布估计视角解决基元冗余,提出配套损失和归一化体积技巧,思路新颖开创。

实验合理度:★★★★★

实验完善,涵盖多种基元、数量、消融,与SOTA公平对比,说服力强。

学术研究价值:★★★★★

提出基于MLE的新训练范式,对混合模型在3D视觉中的应用有启发性。

稳定性:★★★★☆

多配置下稳定超越SOTA,对基元数量减少鲁棒。室外场景稳定性待验证。

适应性以及泛化能力:★★★★☆

在不同基元数量和类型上泛化良好,但仅验证室内场景,泛化性需更多测试。

硬件需求及成本:★★★★★

推理仅需RTX 3090达26+ FPS(512基元),远优于SplatSSC的8.7 FPS,成本极低。

复现难度:★★★★☆

方法描述详细,代码将开源。主要难点在体素化操作,开源后难度降低。

产品化成熟度:★★★☆☆

具身智能核心组件,效率与精度具备产品化潜力,需验证更多环境下的鲁棒性。

可能的问题:FLM损失收敛性分析未做,极端场景可能优化不稳定。当前体素粒度较粗(0.08m),更精细任务表现未知。整体瑕不掩瑜。


主要参考文献

[1] Guanying Chen, et al. FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction. arXiv:2606.21373v1, 2026.
[2] Z. Li et al. SplatSSC: Gaussian Splatting for Semantic Scene Completion. ICLR, 2025.
[3] Y. Huang et al. EmbodiedOcc: Embodied Scene Completion using Mixture Models. ECCV, 2024.
[4] A. Dai et al. Scannet: Richly-annotated 3D Reconstructions of Indoor Scenes. CVPR, 2017.
[5] Yang et al. Depth Anything v2. ECCV, 2024.
项目主页与代码:https://gcchen97.github.io/flm-occ/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。