← 返回 PaperDaily
视觉与图像
南方科技大学最新研究:室内占据预测告别体素分类,32个基元效果优于SOTA,速度3.7倍
室内占据预测,传统方法要么算得慢,要么基元浪费。南方科技大学这篇FLM-Occ,直接把问题换个角度定义——从分类变成估计分布,用最大似然训练。结果呢?只用32个基元,精度超越SplatSSC的1200个,速度还快了快4倍!这思路,有点东西。
龙哥读论文
发布于 2026-08-21 00:20:08
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 室内占据预测,传统方法要么算得慢,要么基元浪费。南方科技大学这篇FLM-Occ,直接把问题换个角度定义——从分类变成估计分布,用最大似然训练。结果呢?只用32个基元,精度超越SplatSSC的1200个,速度还快了快4倍!这思路,有点东西。
原论文信息如下:
室内占据预测,就是给一张单目RGB图,让算法猜出房间里哪些地方有东西、是啥(墙、椅子等)。传统体素分类法把空间切成小方块逐个判断,计算量随体积立方级增长。近两年大家改用混合模型(如高斯体、超二次曲面),每个基元覆盖多个体素,算得快。但训练用体素分类损失,导致很多基元赖在空白区域不走,成了“占着茅坑不拉屎”。
FLM-Occ把问题从分类变成分布估计,用最大似然训练,让所有基元都去“解释”整个场景。
痛点揭秘:为何传统方法会在空区域“虚占茅坑”?
以GaussianFormer、SplatSSC等方法为例,它们初始化一堆基元,根据图像特征调整位置形状,再体素化后用体素分类损失监督。问题在于:当一个占据体素已被某些基元覆盖,其他远离的基元几乎收不到梯度信号。这些“空基元”接收不到“搬家”指令,就成了计算冗余。
论文Fig. 3左边(a)展示了体素分类损失下,远离占据区域的基元收不到有效梯度,无法挪动。右边(b)是MLE,占据体元的梯度可传递到所有基元,给远距离基元明确的“搬家”指示。
破局之法:基于最大似然估计的FLM损失函数
FLM的核心:将占据预测重新定义为体素分布估计问题 。用最大似然估计,找到一组基元参数,使所有真实占据体素出现的联合概率最大。模型全局上让所有基元尽力“解释”整个场景。
FLM损失由两项构成:体积项 惩罚基元总体积,压缩其贴合占据区域;密度项 要求每个占据体素处密度尽可能大,将基元拉过去。两项共同作用,解决“虚占茅坑”。
每个占据体素能为所有 基元提供有效梯度,远距离基元也能收到“搬家指示”,实现端到端全局优化。
巧妙的实现:归一化体积与端到端训练的难题破解
标准混合模型里,每个基元权重加和为1。论文解法:将混合权重定义成归一化的基元体积 。每个基元体积vj,权重wj=vj/∑vk,自动满足约束,且大基元权重更高,逻辑自洽。
FLM的MLE范式下,论文推导了基于密度的体素化公式:某体素x的占据概率是所有基元在该点密度贡献之和;语义分数是该类别下所有基元贡献的和。
FLM-Occ架构精简:输入RGB图,用Depth Anything v2提取特征,通过4个残差精炼块,直接对均匀分布的初始基元进行移动变形,输出占据网格。损失只计算在占据区域上,计算量大降。
实验结果:少即是多,32个基元即可超越SOTA
在Occ-ScanNet和Occ-ScanNet-mini2上评估,结果震撼。
FLM-Occ在Occ-ScanNet上全面SOTA:
基元移动距离统计:SplatSSC约0.15米,FLM-Occ约1.2米,说明其具备远程精确“搬迁”能力。
消融实验表明,微调ViT(相对深度特征)提升极大(mIoU从43.9%到59.2%),密度正则化Lreg带来1-2%增益。
FLM-Occ基元分布紧凑稀疏,体素边界清晰锐利。
总结与展望:道路宽敞,未来可期
FLM-Occ提出新训练范式,将分类转为分布估计,配合MLE损失实现基元精准远程部署。这是对问题定义层 的革新。后续可融合时序信息、扩展到动态场景或更细粒度语义标签。
龙迷三问
FLM损失到底跟普通的体素分类损失有什么区别? 体素分类损失只看局部,当体素被覆盖好时其他基元收不到梯度。FLM损失最大化所有占据体素的联合概率,每个占据体素影响所有基元,具有全局视野 ,引导基元长距离移动。
超二次曲面(Superquadric)和高斯体(Gaussian)有什么区别? 高斯体形状固定(椭球),超二次曲面通过形状参数可模拟长方体、圆柱等多样形状。基元少时超二次曲面更优,高斯体随数量增加效果逼近。
这个方法可以应用到自动驾驶场景吗? 论文针对室内场景,但FLM核心思想通用。自动驾驶场景更大、物体更远,FLM-Occ的远程移动能力契合需求,需适配视角和语义类别,是很有潜力的方向。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★★
从分布估计视角解决基元冗余,提出配套损失和归一化体积技巧,思路新颖开创。
实验合理度: ★★★★★
实验完善,涵盖多种基元、数量、消融,与SOTA公平对比,说服力强。
学术研究价值: ★★★★★
提出基于MLE的新训练范式,对混合模型在3D视觉中的应用有启发性。
稳定性: ★★★★☆
多配置下稳定超越SOTA,对基元数量减少鲁棒。室外场景稳定性待验证。
适应性以及泛化能力: ★★★★☆
在不同基元数量和类型上泛化良好,但仅验证室内场景,泛化性需更多测试。
硬件需求及成本: ★★★★★
推理仅需RTX 3090达26+ FPS(512基元),远优于SplatSSC的8.7 FPS,成本极低。
复现难度: ★★★★☆
方法描述详细,代码将开源。主要难点在体素化操作,开源后难度降低。
产品化成熟度: ★★★☆☆
具身智能核心组件,效率与精度具备产品化潜力,需验证更多环境下的鲁棒性。
可能的问题: FLM损失收敛性分析未做,极端场景可能优化不稳定。当前体素粒度较粗(0.08m),更精细任务表现未知。整体瑕不掩瑜。
主要参考文献
[1] Guanying Chen, et al. FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction. arXiv:2606.21373v1, 2026.
[2] Z. Li et al. SplatSSC: Gaussian Splatting for Semantic Scene Completion. ICLR, 2025.
[3] Y. Huang et al. EmbodiedOcc: Embodied Scene Completion using Mixture Models. ECCV, 2024.
[4] A. Dai et al. Scannet: Richly-annotated 3D Reconstructions of Indoor Scenes. CVPR, 2017.
[5] Yang et al. Depth Anything v2. ECCV, 2024.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群