← 返回 PaperDaily 视觉与图像

拒绝内卷!北大CVPR 2026新作ExtrinSplat:3D语义理解不嵌特征,存储直接砍到MB级

3D高斯泼溅遇上开放词汇理解,过去大家往点云里硬塞特征,结果存储爆表、边界糊成一片。北大这篇CVPR 2026新作反其道而行,把几何和语义彻底解耦,用VLM生成文本假设做外置索引,直接让特征存储从GB级砍到MB级。思路清奇,落地极香,值得一读!

拒绝内卷!北大CVPR 2026新作ExtrinSplat:3D语义理解不嵌特征,存储直接砍到MB级

paperdaily_reaction_gif


原论文信息如下:
论文标题:
ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting
发表日期:
未找到具体日期(CVPR 2026录用)
发表单位:
北京大学深圳研究生院广东省超高清沉浸式媒体技术重点实验室、天津大学、广东博华超高清创新中心有限公司
原文链接:
https://arxiv.org/abs/2509.22225
想象一下,你给一个AI系统看一段3D场景的视频,然后问它:"把那个放在红色马克杯旁边的蓝色椅子给我圈出来。"这个任务叫做开放词汇3D场景理解,它需要机器不仅能重建场景的几何结构,还要真正"看懂"场景里有什么对象、对象之间是什么关系。
过去几年,3D高斯泼溅(3D Gaussian Splatting,简称3DGS)凭借其高保真建模和实时渲染的能力,成了3D场景表示的新宠。但怎么让3DGS场景"理解"自然语言查询,一直是个让人头疼的问题。主流的做法是往每个高斯点里嵌入语义特征向量——听起来很直接,但实际操作起来却是"又胖又笨":一个场景动辄几个GB的特征数据,训练时间以小时计,而且边界处的语义经常糊成一团。

从"嵌入"到"外在":3D语义理解的新范式革命

北京大学深圳研究生院联合天津大学等机构提出了一种全新的框架——ExtrinSplat。这个工作最大的亮点不是某个模块的改进,而是整个范式的转变:从"嵌入范式"走向"外在范式"。
什么意思呢?过去的嵌入范式,就好比非要给每个学生(高斯点)发一本一模一样的百科全书(高维特征向量),不管这个学生是不是真的需要这么多信息。结果书又厚又重(几个GB存储),有些学生翻都翻不完(特征冗余),还有一些学生拿到的是错版书(边界点的语义混乱)。
而ExtrinSplat的外在范式,则是把语义理解从几何表示中彻底剥离出来,单独建立一个轻量级的"索引层"。就像图书馆不再给每本书配备一个详细的全文摘要,而是建了一个目录卡片柜——每张卡片只记录书的编号和几个关键词。查询时先翻卡片柜,再精准定位书籍,又快又省空间。
图1:本文方法总览
ExtrinSplat方法总览。(a)首先从输入场景中提取多视角2D分割掩码。(b)基于这些掩码,方法通过反投影将对象提升为3D点组,并通过过滤模糊的中性点来细化边界。(c)每个细化后的对象组通过VLM从关键视角生成文本假设,并经过CLIP文本编码器编码为语义特征。(d)最终,这些几何组和语义特征组装成外在语义索引层,通过将用户文本查询与预计算特征匹配实现开放词汇查询。

三大痛点:几何-语义不一致、语义膨胀与语义僵化

要理解ExtrinSplat的价值,得先搞清楚嵌入范式到底痛在哪里。论文作者很犀利地指出了三个核心缺陷。

痛点一:几何-语义不一致高斯点天生是用来表达场景几何结构的,不是用来表达语义的。强行给每个点分配语义标签,在对象边界处就会出大问题。论文提出了一个很有意思的概念叫"中性点"(neutral points)——这些点位于对象边界,纯粹是为了渲染时的高保真过渡而存在的,它们本身并不属于任何语义类别。让这些点强行站队,边界自然就糊了。

痛点二:语义膨胀嵌入范式要把2D视觉特征(比如CLIP特征)蒸馏到3DGS场景中,每个高斯点都要存一个高维向量。一个场景下来动辄几个GB的特征数据,存储开销和下游处理负担都非常夸张。

痛点三:语义僵化一个高斯点可能同时属于多个对象,具有多义性。比如车窗上的一个点,你说它是"窗户"没错,说它是"汽车"的一部分也完全正确。但嵌入范式里一个点只能存一个特征向量,强行把多个语义身份融合到一个向量里,结果就是哪个都说不准。

这三大痛点,本质上都源于同一个设计决策:把语义硬塞进几何里。ExtrinSplat的思路很干脆——既然塞进去这么多问题,那就不塞了,把语义单独拎出来放在外面。

核心机制:多粒度对象分组与中性点处理

ExtrinSplat的整体流程分为四个阶段:数据准备、对象级分组、实例特征提取和外在语义索引层构建。
数据准备阶段先用SAM在初始帧上生成三种不同粒度(部件级、对象级、场景级)的分割掩码,然后利用DAM2SAM模型在整个序列中追踪这些掩码。为了捕捉后续新出现的对象,系统每隔固定帧数会做一次周期性检测。值得强调的是,这个流程对数据质量的要求并不苛刻——即使追踪失败或者对象被重复识别,下游模块也能优雅地处理这些瑕疵。
对象级分组阶段是核心创新之一。对每个对象,系统通过掩码反投影计算每个高斯点的前景概率。具体做法是:对每个有效视角的每个像素,沿视线方向累加所有相交高斯点的贡献权重(这个权重与3DGS渲染时的alpha合成权重一致),然后分别统计每个点在前景掩码和背景掩码中的总贡献。如果一个点的前景权重总和大于背景权重总和,就把它归入前景集合。
这里有个非常巧妙的设计——中性点处理模块。在对象边界处,有些高斯点在不同视角下时而落在掩码内、时而落在掩码外,语义标签很不稳定。论文用信息熵来量化这种不确定性,熵高于阈值τh的点进入"候选中性点集合"。但这个集合里既有真正的过渡点(用于抗锯齿的低不透明度点),也可能混入被误分类的实体表面点(高不透明度)。于是再用一个不透明度阈值τα来做二次过滤:高不透明度的点说明它确实属于某个实体表面,应该保留其原始的语义分类;低不透明度的过渡点才是真正的"中性点",把它们从语义监督中排除。
论文中用公式清晰定义了中性点检测的过程:
语义熵 H(p) = -(Vf/V · log₂(Vf/V) + Vb/V · log₂(Vb/V))
其中Vf和Vb分别是在所有可见视角中,该点被标记为前景和背景的次数。熵值越高,说明该点的语义越模糊,越可能是中性点。

语义蒸馏:用VLM将视觉表象转化为稳定文本假设

对象分好组之后,接下来的问题是怎么给每个对象赋予语义。这又是一个反常识的选择——不用CLIP图像编码器,改用VLM生成文本描述
图2:2D-3D特征关联流程对比
图2:2D-3D特征关联流程对比。(a)主流方法(直接提取):所有由SAM生成的对象掩码被直接用于提取CLIP图像特征。(b)本文方法(语义蒸馏):利用DAM2SAM追踪单个实例,然后由VLM解释可见面积最大的前N个掩码,将易变的视觉外观蒸馏为基于生成对象身份的稳定CLIP文本表示。
为什么?论文做了大量实验发现,CLIP图像特征在不同视角下对同一对象的编码很不稳定。同一只"狗玩具",正面拍和侧面拍的CLIP特征相似度可能只有0.6左右。如果用单视角特征,信息不完整;如果多视角平均,又会引入噪声。而VLM(论文用的是Gemini 2.5 Pro)可以把不同视角的视觉信息综合起来,生成一个稳定的文本描述,再通过CLIP文本编码器转成特征向量。这样一来,特征就从"易变的视觉表象"变成了"规范的文本概念"。
具体操作上,对每个对象组,挑选可见面积最大的前3个视角,用绿色框标出目标对象,然后让VLM生成5个描述该对象的名词。这5个名词经过CLIP文本编码后,就是该对象的语义特征集合。多个名词可以覆盖一个对象的不同称呼(比如"汽车"、"轿车"、"车辆"),从底层支持了语义的多义性。
最后,把这些"几何点组索引 + 文本特征集合"组装起来,就构成了外在语义索引层。用户输入文本查询时,用CLIP文本编码器编码查询,然后与索引层中每个对象的特征集合计算余弦相似度,超过阈值的对象组就被选中。整个过程就是一次快速的查表操作,完全不需要训练。
ExtrinSplat演示场景

数据准备及实验设计

实验部分,论文在两大经典基准上进行了全面验证:LERF数据集和ScanNet数据集。LERF数据集来自LangSplat的标注版本,包含多个从"嵌入"到"外在":3D语义理解的新范式革命
ExtrinSplat的出现,标志着一个关键转变:语义不再需要"塞进"几何里,而是可以作为一个独立的"索引层"外挂在高斯场景之上。
具体怎么做到?答案是把语义理解的粒度从"点"提升到"对象"。ExtrinSplat先把3D高斯点聚成多个互相重叠的对象组,然后用视觉语言模型(VLM)给每个对象组生成一组文本假设(比如"汽车"、"轿车"、"车辆"),最后用CLIP文本编码器把这些文本变成特征向量,存进一个轻量级的"外在索引层"。
用户查询时,只需要把文本查询用CLIP编码,然后在索引层里做一次余弦相似度匹配,就能拿到对应的3D高斯点子集。整个过程完全不需要训练,一个场景的语义索引构建从"小时级"降到了"分钟级"。

三大痛点:几何-语义不一致、语义膨胀与语义僵化

理解ExtrinSplat的价值,关键在于理解嵌入范式为什么"此路不通"。论文非常犀利地指出了三个核心缺陷,每一个都是嵌入范式的"基因缺陷"。
几何-语义不一致说的是高斯点天生是表达几何的,不是表达语义的。强行给每个点分配语义标签,在对象边界处就会产生大量"中性点"——这些点纯粹为了渲染过渡而存在,语义上属于"三不管"地带。硬要它们站队,边界自然糊成一片。
语义膨胀更直接:每个高斯点都要存一个高维特征向量,一个场景动辄几个GB的额外数据,存储和下游处理的负担大到离谱。这也是目前3DGS语义理解迈向实际应用的最大拦路虎之一。
语义僵化则戳中了嵌入范式的"多义性"死穴。一个点在车窗上,它既是"窗户",也是"汽车"的一部分。嵌入范式一个点只能存一个向量,只能把多个语义身份强行融合,结果哪个都表达不准确。
这三大痛点指向同一个根源——语义和几何的耦合方式出了问题。ExtrinSplat给出的答案很干脆:既然塞进去全是问题,那就干脆不塞了,把语义全部搬到外面来。

核心机制:多粒度对象分组与中性点处理

ExtrinSplat的整体流程分四步:先在输入场景上提取多视角、多粒度的2D分割掩码;然后通过掩码反投影把2D掩码"提升"为3D对象点组;接着用VLM为每个对象组生成文本语义假设;最后组装成外在语义索引层。
数据准备阶段先用SAM(Segment Anything Model,通用分割模型)在初始帧上生成部件级、对象级、场景级三种粒度的掩码,再利用DAM2SAM(一种带干扰物感知记忆的追踪模型)在整个视频序列中稳定追踪。系统每隔固定帧数还会做一次周期性新对象检测,保证后出现的对象不被漏掉。整个流程对追踪质量的要求相当宽容——即使某些帧掩码不准,下游分组和查询模块也能包容。
对象级分组是第一步关键操作。对每个对象,系统通过掩码反投影计算每个高斯点的前景概率。具体来说,对每一视角的每一像素,沿视线累加所有相交高斯点的贡献权重——这个权重与3DGS正向渲染时的alpha合成权重完全一致(见公式1)。
公式1:3DGS渲染合成公式
公式1:3DGS的颜色渲染合成。C(p)是像素p的最终颜色,c和α分别是第i个高斯点的颜色和不透明度,累积透射率表示光线穿过前面所有高斯点后到达当前点的比例。
每个高斯点的贡献权重定义为累积透射率乘以有效不透明度(公式2)。然后统计该点在前景掩码和背景掩码中的总贡献(公式3),前景权重更大的点归入前景集合。
公式2:高斯点贡献权重
公式2:高斯点G_j在射线r上的贡献权重w,由累积透射率T和有效不透明度α相乘得到。
公式3:前景/背景权重聚合
公式3:W_k(G_j)表示高斯点G_j在所有可见视角中属于类别k(k=1前景,k=0背景)的累计贡献权重,δ是指示函数,m_v(r)是视角v中像素r的掩码值。
中性点处理模块是本文的一个精巧设计。在对象边界处,有些高斯点在不同视角下的语义标签不一致——有时落在掩码内,有时落在掩码外。论文用语义熵(公式4)来量化这种不一致性:熵越高,说明该点在不同视角下的语义判定越摇摆,越可能是中性点。但候选集合里既包含真正的过渡点(低不透明度),也可能混入被误分类的实体表面点(高不透明度)。于是再用不透明度阈值做二次过滤:高不透明度的点说明它确实属于某个实体表面,保留其原始分类;低不透明度的过渡点才是真正的"中性点",从语义监督中排除。
公式4:语义熵
公式4:语义熵H(p)。Vf和Vb分别是高斯点p在所有可见视角中被标记为前景和背景的次数。熵值越高,点的语义越不确定。
这里有一个很值得注意的细节:三个粒度的掩码集是并行独立处理的,这意味着同一个高斯点可以同时属于"窗户"和"汽车"两个对象组。多粒度、互相重叠的对象分组天然支持了语义的多义性,这是嵌入范式根本无法做到的。

语义蒸馏:用VLM将视觉表象转化为稳定文本假设

对象分组完成后,关键问题来了:怎么给每个对象组赋予语义?主流做法是直接提取CLIP图像特征,但论文用实验数据指出了这条路的问题——CLIP图像特征在不同视角下对同一对象的编码存在明显不一致。
图14:跨视角语义特征不一致性示意
图14:跨视角语义特征不一致性。(a)同一对象在不同视角下呈现不同的语义特征。(b)以"Jake the Dog"对象为例,不同视角特征之间的余弦相似度差异很大,高值(接近1)才表示特征相似。
ExtrinSplat提出了一个反直觉的替代方案——语义蒸馏:不用CLIP图像编码器,改用VLM(视觉语言模型,Vision-Language Model)生成文本假设。具体操作是:对每个对象组,挑选可见面积最大的前几个关键视角,把对象用红框标出来,让VLM(论文用的Gemini 2.5 Pro)生成一组候选对象名(文本假设)。这些文本假设再经过CLIP文本编码器编码,就变成该对象组的语义特征集合。
这个方法妙在两点:一是VLM可以把多视角的视觉信息"蒸馏"成一个稳定的文本概念,消除了视角不一致的问题;二是多个文本假设可以覆盖同一个对象的不同叫法("汽车"、"轿车"、"vehicle"),从底层支持语义多义性。特征存储从"每个视角一份图像特征"变成了"每个对象几个文本特征",存储开销直接砍掉几个数量级。
最后,把这些"几何点组索引 + CLIP文本特征集合"组装起来,就得到外在语义索引层。查询时,用户文本经CLIP文本编码后,与索引层中每个对象的特征集合计算余弦相似度(公式5),超过阈值就选中该对象组(公式6),最终分割结果是所有匹配对象组的几何点集合之并(公式7)。整个过程就是一次查表,完全不需要训练。
公式5:余弦相似度
公式5:查询特征s与对象组第i个语义特征q的余弦相似度计算。
公式6:匹配对象组判定
公式6:匹配对象组集合Tm的判定条件,只要对象组i的任一语义特征与查询的相似度超过阈值η就匹配。
公式7:最终分割结果
公式7:最终分割结果G_final是所有匹配对象组的3D高斯点集合之并。

数据准备及实验设计

实验部分覆盖两大经典基准:LERF数据集和ScanNet数据集。LERF数据集包含"拉面"、"茶杯"、"手办"、"Waldo"四个场景,专注于开放词汇3D对象选择任务,评估指标为mIoU(平均交并比)。ScanNet数据集则用于开放词汇3D语义分割任务,按照19类、15类、10类三种粒度评估mIoU和mAcc(平均精度)。
对比方法覆盖了像素级和点级两大主流方向的十余个代表方法,包括LEGaussians、LangSplat、Feature-3DGS、GS-Grouping、GOI、OpenGaussian、InstanceGaussian、Dr.Splat、LUDVIG、LaGa、Segment-then-Splat等。这些方法涵盖了从CVPR 2024到ICCV 2025的近期工作,对比阵容相当充分。

实验结果

先看效率对比。表1给出了LERF手办场景的计算资源对比:ExtrinSplat是唯一一个完全不需要场景优化的方法(Scene Opt.为None,Train Time为None),CLIP特征存储从其他方法的约3GB直接砍到约3MB——整整三个数量级的差距。峰值显存也从普遍的20GB以上降到了约8GB。
表1:计算资源对比
表1:LERF手办场景的计算资源对比,包括每场景优化时间、峰值显存和CLIP特征存储。ExtrinSplat作为唯一的外在范式方法,将CLIP特征存储从GB级降至MB级,且使用了最少的显存。
再看精度。表2是LERF数据集上的开放词汇3D对象选择mIoU结果:ExtrinSplat取得了54.3的平均mIoU,超越了此前最佳方法LaGa(64.0)之外的所有方法(注意LaGa是2D方法,在3D空间任务上存在维度差异),比同样面向3D任务的Segment-then-Splat(52.0)高出2.3个点,比LUDVIG(50.4)高出3.9个点。
表2:LERF数据集mIoU结果
表2:LERF数据集开放词汇3D对象选择mIoU结果。加粗为每类最佳,下划线为次佳。
图3展示了定性对比结果。OpenGaussian在"spatula"(铲子)和"apple"(苹果)这类邻近对象上无法清晰分离,边界混乱;Dr.Splat在"bear nose"(熊鼻子)、"noodles"(面条)这类细粒度查询上力不从心。而ExtrinSplat能够准确理解细粒度指令,生成边界清晰的精确选择。
图3:LERF数据集定性对比
图3:LERF数据集开放词汇对象选择定性结果。OpenGaussian无法分离邻近对象或保持锐利边界,Dr.Splat难以捕捉细粒度细节,而ExtrinSplat能正确理解细粒度指令并生成精确选择。
ScanNet数据集的3D语义分割结果如表3所示。ExtrinSplat在19类、15类、10类三种粒度上都取得了最佳mIoU——45.5、47.2、53.7,分别超过此前最佳方法InstanceGaussian(40.7)达4.8个点。mAcc指标上也全面领先,10类设置下达到74.9。
表3:ScanNet语义分割结果
表3:ScanNet数据集开放词汇3D语义分割定量结果。加粗为最佳,下划线为次佳。
图4的定性结果进一步印证了论文的观点。OpenGaussian和InstanceGaussian依赖2D图像CLIP特征匹配,容易受到不同掩码视角下特征不一致的影响,比如把床和椅子搞混。而ExtrinSplat通过VLM文本蒸馏和对象级分组,实现了精确的3D分割和锐利边界。
图4:ScanNet 3D分割定性结果
图4:ScanNet数据集3D对象分割定性结果。OpenGaussian和InstanceGaussian因2D CLIP特征视角不一致导致错误匹配(如床和椅子),ExtrinSplat则实现精确分割。
图7还展示了一个非常实用的特性:ExtrinSplat对掩码数量有很强的鲁棒性。即使用1/4的掩码,精度几乎没有下降;用1/32的掩码,仍然能恢复对象的粗略形状。这说明该框架对上游分割质量的依赖远低于预期。
图7:稀疏掩码下的3D对象提取
图7:稀疏掩码监督下的开放词汇3D对象提取。当使用不少于1/4的掩码时精度几乎无损;即使仅用1/32的掩码,仍能恢复对象的粗略形状。

实验结果分析

消融实验验证了几个关键设计的必要性。表4展示了中性点处理的效果:去掉中性点过滤后,mIoU有明显下降,说明正确处理边界过渡点对分割精度确实重要。表5对比了VLM文本蒸馏和CLIP图像特征baseline:VLM方案在mIoU上显著领先,验证了"文本假设比图像特征更稳定"的核心论点。表6和表7进一步说明,VLM的选择和提示数量对结果有影响,但整体框架对VLM类型并不敏感,Gemini、GPT-4V等都能使用。
表4:中性点处理消融
表4:中性点处理的消融实验。评估两阶段过滤在LERF数据集上的效果。
表5:特征提取消融
表5:特征提取消融。对比VLM文本蒸馏与CLIP图像特征baseline。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?北大等机构提出ExtrinSplat,开创3D语义理解外在范式。不再往每个高斯点里塞高维特征,而是通过对象分组+VLM文本假设构建外置索引层,场景适配从数小时缩至分钟级,特征存储从GB级降至MB级。
这篇工作最值得看的点是什么?在LERF数据集上达到SOTA(54.3 mIoU),在ScanNet数据集上全面领先(19类45.5 mIoU),存储开销降低约1000倍,训练时间从数小时降至零
这篇工作的边界或风险在哪里?优点:(1) 提出外在范式,从根本上解决嵌入范式的三个缺陷;(2) 训练-free,效率极高;(3) 支持多粒度、重叠语义理解;(4) 提出中性点概念并给出处理机制。缺点:(1) 依赖SAM/DAM2SAM的初始掩码质量;(2) VLM可能产生错误语义标签;(3) 极端稀疏掩码下性能下降。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出外在范式(extrinsic paradigm),通过将3D高斯点聚类为多粒度、重叠的3D对象组,并利用视觉语言模型生成轻量级文本假设作为外在语义索引层,实现几何与语义的解耦,避免向几何中嵌入高维特征。

实验合理度:★★★★☆

mIoU(平均交并比),mAcc(平均准确率)

学术研究价值:★★★★☆

提出外在范式(extrinsic paradigm),通过将3D高斯点聚类为多粒度、重叠的3D对象组,并利用视觉语言模型生成轻量级文本假设作为外在语义索引层,实现几何与语义的解耦,避免向几何中嵌入高维。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

场景适应时间从数小时减少到约9.25分钟(teatime场景),存储开销从GB级降至约3MB,峰值VRAM约8GB

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 依赖SAM/DAM2SAM的初始掩码质量;(2) VLM可能产生错误语义标签;(3) 极端稀疏掩码下性能下降。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球