UTTO的全称是 Uncertainty-Guided Test-Time Optimization,中文可以理解为“不确定性引导的测试时优化”。这里的关键词有两个:测试时优化和不确定性引导。前者表示模型不重新训练,只在推理阶段微调当前场景的预测;后者表示优化时不是一视同仁地修所有点,而是先判断哪些点更“飘”。论文的整体流程可以概括成三步:先用深度-only输入跑出一个冻结的开放词汇3D模型,再通过多次“合法扰动”看它对同一场景的判断稳不稳,最后把这种稳定性变成权重,去指导推理阶段的优化。这个思路很像考试时先看哪些题全班都做对了,再重点盯着那些大家答案分歧很大的题目。稳的少动,飘的多修,逻辑非常朴素,但在工程上很实用。公式1:多次测试时增强后的预测输出。这里的意思是,对同一个几何场景做多种语义保持的扰动,比如旋转、体素相位偏移等,冻结模型分别输出每次扰动下的类别分布,再把这些分布映射回原始空间。M表示扰动次数,P(m)表示第m次增强后的预测。接下来就是UTTO最关键的一步:从多次预测的一致性里估计不确定性。某个点如果在不同扰动下都被判成同一类,说明它比较稳;如果每次都摇摆不定,说明它很虚。论文把这种“投票一致性”写成一个可靠性信号,再把它转成权重。简单说就是:越稳的点,越听它自己的;越不稳的点,越交给后面的正则去拯救。公式2:基于预测一致性的可靠性估计。Δv表示第v个点在多次预测中对多数类别的投票占比,数值越大,说明这个点越稳定、越可靠。这个量本质上就是“大家意见统一不统一”。公式3:将可靠性映射为优化权重。wv是点v的权重,wmin是下限,作用是防止某些极不确定的点被直接“放生”。这一步很关键,说明作者并没有粗暴地把低置信点全扔掉,而是保留了一点约束,避免优化失控。有了权重之后,优化目标就清楚了:可靠点尽量别乱改,不可靠点允许被几何一致性和语义先验拉一把。这里的“测试时优化”不是训练新的网络参数,而是优化每个点的类别分布。换句话说,模型骨架不动,动的是当前场景的输出分布。这样做的好处很明显:不需要额外标注,也不需要重新训练,很适合隐私约束下的部署。但只靠“不确定性”还不够,论文又补了两类先验。第一类是文本侧去偏:开放词汇模型本来就依赖文本原型做分类,如果只用单一模板,比如“a chair in a scene”,很容易被措辞带偏。于是作者用多个通用模板做prompt ensemble,中文可以叫“提示词集成”,让类别原型更稳一点。公式4:用模板生成类别提示句。sc;k表示第c类在第k个模板下生成的文本提示,nc是类别名,K是模板数量。意思很简单:同一个类别,不要只让模型从一个句式里理解,而是从多个说法里综合判断。公式5:多模板文本原型的构造方式。这里是把多个模板编码后的文本嵌入先归一化,再平均,再归一化,得到更稳的类别原型tc。这一步的作用,就是降低文本表达方式带来的偏差。第二类先验是特征空间一致性。光看空间邻近还不够,因为深度-only里很多相邻点虽然挨得近,但语义未必一样。于是作者又在一个冻结的特征空间里建图,让语义相近的点彼此约束。这个特征不是来自真实RGB,而是来自深度渲染后的固定颜色映射,再送进冻结的DINO编码器提特征。注意这里没有偷用真实颜色,还是守住了隐私边界。于是,UTTO的总目标就成了三件事一起干活:可靠点稳住、几何上别乱跳、语义上别分裂。这套设计的聪明之处在于,它没有指望深度-only突然变成RGB,也没有强行让模型“自信一点”。相反,它承认不确定性存在,然后把它组织起来,变成优化信号。这个思路,比很多“把问题藏起来”式的方法要诚实得多。👍
[1] Huang X, Pan S, Bennewitz M. Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization. arXiv:2607.00978v1, 2026.[2] 论文中关于不确定性、测试时优化、开放词汇3D分割与隐私保护感知的相关工作引用,详见原文参考文献部分。