← 返回 PaperDaily 视觉与图像

KAIST&MIT最新:无需训练!0.4秒搞定任意特征上采样,各项SOTA

不用训练、不用改模型,单张图优化不到半秒,就能把基础模型低分辨率特征放大成高分辨率特征,还在分割、深度、概率图上一口气刷到SOTA。想给视觉基础模型做“像素级复活”的同学,这篇绝对是宝藏基线。

KAIST&MIT最新:无需训练!0.4秒搞定任意特征上采样,各项SOTA
原论文信息如下:
论文标题:
Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling
发表日期:
2025年11月
发表单位:
KAIST、MIT、Microsoft
原文链接:
https://arxiv.org/pdf/2511.16301.pdf
要说这几年视觉领域最“闷声干活”的一类技术,特征上采样绝对排得上号。大家平时关注的都是SegFormer、DPT这类又大又复杂的解码器,很少有人想一个问题:能不能不训练、不改模型,就把基础模型里那又粗又糊的低分辨率特征,直接放大成高清像素级特征?
今天这篇论文,来自KAIST、MIT和Microsoft的合作,给大家端上了一个堪称“简单到难以击败”的baseline——Upsample Anything。名字就透着一股豪气:上采样一切。单张图只要约0.419秒,不需要任何数据集级训练,语义分割、深度估计、深度图恢复、概率图放大甚至3D特征都能一把梭,而且多项任务直接刷到当前最优。

无需训练的上采样神器:0.4秒搞定任意特征放大

Upsample Anything整体效果展示
先别急着划走,这活儿还真不是PyTorch里一行F.interpolate能搞定的。本文上采样的是“特征”,不是图像。熟悉视觉基础模型(Vision Foundation Model,VFM)的朋友都知道,像DINOv2、CLIP、SigLIP这些模型,特征图通常被固定下采样14倍或16倍。要用这么粗的特征去干像素级预测,传统做法是堆一个又大又重的解码器,比如DPT、UPerNet、SegFormer。但这样一来,算力开销大、迁移性差,换一个backbone往往就要重新训练解码器。
近年来,研究者们提出了不少专门的特征上采样方法,比如FeatUp、LoftUp、JAFAR、AnyUp。按照优化方式,大致分成两大流派。第一派是数据集级训练(dataset-level training):在成对的低分辨率特征-高分辨率真值上训练一个上采样器,换一个backbone或者数据集就得重新训练,而且受显存限制,大多数方法只能处理112到224像素分辨率。第二派是测试时优化(Test-Time Optimization,TTO):典型代表是FeatUp隐式版本,它不依赖离线训练,但每张图要优化大概49秒才能收敛,速度感人。
图2:数据集级训练与本文测试时优化(TTO)的对比。(a) 数据集级方法(FeatUp、LoftUp、JAFAR、AnyUp)需要成对训练数据,且只能处理2D特征图。(b) 本文的Upsample Anything仅用一张高分辨率图像执行TTO,可泛化到特征、深度、分割甚至3D特征。
Upsample Anything走了一条中间路线:还是测试时优化,但把每张图的优化时间压缩到约0.419秒,比FeatUp隐式版本快了差不多100倍。它的做法非常反直觉——先用高分辨率RGB图像做引导,优化出一组逐像素的各向异性高斯参数;然后把这组参数直接搬到低分辨率特征图上,完成高分辨率特征的渲染。整个过程不需要任何配对数据,也不需要训练一个神经网络,纯靠几十步梯度优化就能搞定。
这设计听起来简单,背后其实站着一个非常经典的理论框架——Joint Bilateral Upsampling(JBU,联合双边上采样),以及近几年火得一塌糊涂的2D Gaussian Splatting(二维高斯泼溅)。把二者在数学上统一起来,是这篇论文最“秀”的地方。

从JBU到高斯泼溅:一个统一的理论框架

先说说JBU。它是2007年提出的一种经典非学习型上采样方法,专门用来把低分辨率的深度图或标签图,在高分辨率RGB图像的引导下放大。核心思想就一句话:空间越近、颜色越像的像素,权重越高。公式长这样:
JBU公式
其中p是高分辨率坐标,q是低分辨率坐标,I是RGB引导图,σ_s控制空间距离的敏感度,σ_r控制颜色差异的敏感度。大白话翻译:每个输出像素的颜色,不是凭空生成的,而是周围低分辨率像素按“距离近不近”和“颜色像不像”加权平均出来的。由于颜色差异大的区域(也就是边缘)权重会被压到很低,边缘自然就保住了。
再说2D Gaussian Splatting(2DGS)。它把图像上的每个像素或小块表示成一个二维高斯核,有自己的中心、协方差矩阵(编码长短轴和旋转角度)和透明度,最终渲染图像就是对这些高斯做加权求和。2DGS的渲染公式可以写成:
2DGS渲染公式
其中μ_i是第i个高斯的中心,Σ_i是它的协方差矩阵,α_i是权重,c_i是颜色或特征。如果把JBU的每个低分辨率采样点看成一个固定各向同性的高斯,那么JBU其实就是2DGS在特定约束下的一个离散特例。也就是说,JBU是“每个点的核形状都一样、方向都一样”的高斯泼溅,而2DGS允许每个点有自己不同的形状和方向。
图3:Upsample Anything总览。给定高分辨率图像I_hr,将其降采样为I_lr,并优化GSJBU重建I_hr,从而学习逐像素各向异性核参数{σ_x, σ_y, θ, σ_r}。训练好的核随后被应用到低分辨率特征F_lr上,渲染出高分辨率特征F_hr,实现像素级各向异性联合双边上采样。
这篇论文的关键洞察就在这里:既然JBU本质上是高斯泼溅的特例,那为什么不让每个低分辨率位置都拥有自己的各向异性高斯核呢?这样上采样就从一个全局固定的滤波器,变成了一个逐像素自适应的边缘感知算子。论文把这个统一框架称为GSJBU,即Gaussian Splatting Joint Bilateral Upsampling(高斯泼溅联合双边上采样)。

逐像素各向异性核:让上采样学会“看”边缘

GSJBU到底是怎么做到又快又准的?核心在于它为每个低分辨率位置q分配了4个可优化的参数:σ_x(q)、σ_y(q)(控制高斯的长轴和短轴)、θ(q)(控制旋转方向)和σ_r(q)(控制颜色范围敏感度)。空间协方差矩阵写为:
空间协方差矩阵公式
R(θ_q)是旋转矩阵。直观上,这个设计允许高斯核沿着边缘方向被拉长,垂直于边缘方向被压扁。这样一来,上采样时权重会更多地沿着边缘方向混合,而不会跨过边缘“串色”。与此同时,σ_r(q)控制着颜色差异的惩罚强度,颜色差异大的邻居即使空间距离再近,权重也会被压低。
图10:学习到的高斯核可视化。(a) 原始图像,(b) 在低分辨率输入上叠加显示的高斯核。可以看出这些核具有局部一致的方向和大小,说明学习到的核能够自适应场景的底层结构。
完成最终权重归一化之后,输出特征就是低分辨率特征按权重做加权平均:
特征渲染公式
注意,这一步是纯混合(mixing),不是生成。它严格地对已有低分辨率特征重新加权,不产生任何新数值,所以天然具备跨模型、跨任务的迁移能力。这也是整篇论文最妙的地方——核的学习只看RGB引导图,核的应用却放在特征图上。因为RGB图像的结构信息(边缘、纹理、方向)和特征图的结构信息在空间上是共享的,所以用RGB学出来的权重完全可以直接拿给特征图用。
Upsample Anything语义分割流程动画
那么这些核是怎么学出来的?答案很朴素:先模拟视觉基础模型的降采样过程,把高分辨率RGB图像用双线性插值下采样到与低分辨率特征相同的尺寸,再让GSJBU把这个低分辨率图像重建回高分辨率。优化目标就是重建误差:
测试时优化损失函数
整个优化过程只用Adam优化器跑50步,学习率1×10⁻³,没有任何批处理和数据增强。各参数初始化也很简单:σ_x=σ_y=16,σ_r=0.12,θ=0。因为每张图优化的只是每像素4个标量,所以收敛极快。优化完成后,把这组参数直接用于特征渲染:
特征渲染公式
整个流程看下来,没有学习任何神经网络权重,也没有使用任何标签,这就是为什么它能做到“无需训练却处处自适应”。相比之下,FeatUp隐式版本每张图要优化49秒,Upsample Anything只花0.419秒,算是在效率和效果之间找到了一个极佳的平衡点。

全面碾压:分割、深度、概率图一个都不少

方法讲完,看疗效。论文在语义分割、深度估计、深度图恢复、概率图恢复等任务上做了一整套实验,对比对象包括FeatUp、LoftUp、JAFAR、AnyUp等当前主流方法,backbone覆盖了DINOv1、DINOv2、DINOv3、CLIP和ConvNeXt,可以说覆盖面相当广。
先看语义分割。在COCO、PASCAL-VOC和ADE20K三个数据集上,按照惯例采用线性探测协议(只训练一个1×1卷积头),本文方法在mIoU和Acc两项指标上都拿到最高,尤其ADE20K上的mIoU达到42.95,比第二名的AnyUp高出近1个百分点。更亮眼的是表格最后一行“Upsample Anything (prob.)”——这个变体不在特征分辨率上做上采样,而是先在低分辨率上预测出概率图,再用本文方法把概率图放大16倍。结果很有意思:计算量最小,精度反而最高,COCO mIoU达到63.40,比直接上采样特征还要高2个点。这给分割任务提了个醒:也许“先小分辨率算概率,再放大概率图”比“先放大特征,再小分辨率算概率”更划算。
表1:不同上采样方法在COCO、PASCAL-VOC和ADE20K数据集上的对比结果。
论文还把分割pipeline放在一起做了对比,可以直观看到传统分割、特征上采样分割、以及本文“分段-再上采样”三条技术路线的区别。图中最下面一条就是Upsample Anything的分割流程:编码器出低分辨率特征,一个小解码器出低分辨率分割结果,最后用本文方法把分割图(logits)放大回原分辨率。
图8:分割pipeline的对比。(a) 传统分割pipeline,使用VFM编码器和DPT、UPerNet、SegFormer或Mask2Former等任务专用解码器。(b) 使用FeatUp、LoftUp、JAFAR或AnyUp等预训练上采样器的特征上采样pipeline。(c) 本文提出的Upsample Anything,执行测试时优化,无需额外训练即可同时处理特征和分割结果的上采样。 图11:先分割后上采样pipeline的可视化结果。分割logits先在低分辨率下生成,再用本文方法上采样16倍。结果显示物体边界非常锐利,语义一致性保持良好,证明了该上采样方法的有效性。
再看深度估计。在NYUv2数据集上,本文方法使用冻结的DINOv2骨干加轻量DPT风格解码头,RMSE降到0.498,δ1达到0.829;表面法线估计的Mean、Median和各角度阈值指标同样全面领先。值得注意的是,深度任务上特征上采样带来的提升明显比分割任务更大,说明几何类任务对空间细节敏感,一个好的上采样算子能实实在在地转化为精度收益。
表2:NYUv2数据集上深度估计和表面法线估计的对比。
除了特征上采样,Upsample Anything还能直接做深度图恢复。实验设置很极端:把512×512的深度图下采样到32×32,再恢复回512×512。在Middlebury数据集上,本文方法RMSE降到0.209,显著优于双线性插值和GLU;在NYUv2上,虽然数值上双线性略占优,但从可视化结果可以明显看到,本文方法恢复了更锐利的边缘和更连贯的几何结构。这其实暴露了RMSE这类指标的局限——当GT本身是平滑深度图时,锐利的预测反而会在数值上吃亏。
表3:NYUv2和Middlebury深度图上采样的对比结果。 图4:Middlebury(上)和NYUv2(下)上的深度上采样结果。32×32低分辨率深度图用不同方法放大到高分辨率。Upsample Anything恢复了更锐利、更细致的边缘。
接下来看泛化能力。论文做了一组跨分辨率对比,输入从32×32一路降到4×4。AnyUp在32×32和16×16上还凑合,到7×7甚至4×4就开始“摆烂”,输出区域明显过平滑;而Upsample Anything即使面对4×4的极端输入,依然能恢复出清晰的边界和结构。另一个值得注意的点是,AnyUp在512×512分辨率就会显存溢出,而本文方法由于没有构建稠密相似度矩阵,显存随输出分辨率线性增长,跑到896×896依然稳定。
图5:不同输入分辨率下的对比结果。AnyUp(此前SOTA)和Upsample Anything在不同输入分辨率上的定性比较。 表4:不同输入分辨率下AnyUp和Upsample Anything的推理时间与GPU内存对比。两种方法都无需训练,但Upsample Anything执行逐图测试时优化(TTO),计算成本略高,但泛化能力显著更强。
跨backbone的表现也很能打。论文在DINOv1、DINOv2、DINOv3、CLIP和ConvNeXt五个backbone上做了可视化对比。由于不同模型下采样倍数不同,特征分辨率从7×7到16×16不等,AnyUp在部分backbone上会出现明显的模糊和特征混叠,而Upsample Anything始终能保持锐利边界和清晰的特征聚类。这种“一个算子通吃所有架构”的属性,正是数据集级训练方法很难做到的。
图6:跨backbone的定性对比。对于同一个224×224输入,不同backbone的特征图分辨率不同(ConvNeXt为7×7,CLIP和DINOv1为14×14,DINOv2/v3为16×16)。Upsample Anything在所有backbone上都产生了更锐利的边缘、更丰富的纹理和更清晰的特征聚类。
论文还做了特征相似性分析,模拟少样本分割中常见的query-support匹配场景。实验显示,AnyUp上采样后的特征相似度图整体偏高,空间区分度不足;而Upsample Anything生成的相似度图边界清晰、区域分明。这种“有判别力”的特征,对少样本分割和类别级特征匹配这类下游任务天然友好。
图7:参考图像与目标图像之间的特征相似性可视化。先将参考图像掩码内的特征求平均,再与目标图像所有位置的特征计算余弦相似度。
最有野心的是3D特征上采样。论文展示了把3D特征体直接上采样的结果,用PCA把每个深度切片的特征投影到RGB空间可视化。可以看到恢复出的3D特征层在深度方向上平滑过渡,同时保留了精细的物体边界和几何连续性。这暗示Upsample Anything不仅仅是一个2D工具,未来在神经辐射场、3D重建等方向也可能找到用武之地。
图9:3D特征上采样结果可视化。前两列显示RGB图像和对应的深度图,其余面板展示了重建后的3D高分辨率特征体中具有代表性的深度切片,每个切片通过PCA投影到RGB空间。可以看出恢复的3D特征层在深度轴上平滑过渡,同时保持了精细的物体边界和几何连续性。
最后看效率。论文在表5中把GSJBU与GLU(Guided Linear Upsampling,引导线性上采样)、2DGS(2D Gaussian Splatting,二维高斯泼溅)放在一起对比。GLU虽然也是双边滤波思路,但未加约束的优化不稳定;2DGS虽然能建模局部结构,但稠密高斯表示计算量太大,优化时容易过平滑。GSJBU在精度、速度和可扩展性上取得了最好的平衡。
表5:不同上采样方法在推理时间、分割和深度估计性能上的对比。GSJBU在精度和可扩展性之间取得了最佳平衡。

局限与展望:噪声下的挑战与未来方向

别看前面吹得天花乱坠,这篇论文其实有一个非常明显的短板:噪声鲁棒性。由于TTO是在每张测试图上直接优化,它本质上是在“拟合”这张图的所有细节,包括噪声。论文专门做了一组低信噪比实验,在输入图像上分别加了10%和20%的噪声。结果显示,AnyUp这类基于预训练模型的方法对噪声相当稳定,而Upsample Anything直接训练时会过拟合到噪声像素上,放大后的特征里明显出现了噪声带来的伪影。
图12:低信噪比和噪声干扰下的定性对比。从左到右:RGB输入、低分辨率特征、AnyUp的上采样特征、Upsample Anything的结果。从上到下:干净图像、10%噪声、20%噪声。AnyUp在噪声下保持稳定,而本文基于TTO的方法会过拟合噪声像素,暴露了在损坏输入上直接优化的局限性。
这是所有TTO方法都绕不开的“阿喀琉斯之踵”:自适应是一把双刃剑,既能适应结构,也会适应噪声。未来可以考虑在优化目标中加入去噪正则项,或者先用一个轻量级去噪器预处理输入,又或者把TTO和数据集级方法做混合,先用预训练上采样器给一个合理的初始化,再用TTO做精细化调整。另外,虽然0.419秒已经很快,但在视频流或者实时场景中,逐图优化的开销仍然不可忽视,如何把TTO扩展到视频时序版本也是一个值得探索的方向。
还有一个细节值得留意:论文在语义分割实验中发现,当backbone能力足够强时,所有上采样方法相对双线性插值的提升其实都很有限。这倒不是否定特征上采样的价值,而是提醒大家,在强表征条件下,上采样带来的增量会被稀释;相比之下,深度估计、表面法线这类几何任务对上采样的敏感度要高得多。所以如果你的应用场景是几何密集预测,Upsample Anything这类方法值得重点考虑;如果只是拿强backbone刷分割榜,那先把注意力放在解码器设计上可能更划算。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?KAIST与MIT联合提出Upsample Anything,一种不依赖数据训练的特征上采样框架:通过轻量测试时优化学习逐像素各向异性高斯核,0.419秒/图即可完成224×224图像的特征超分,在语义分割、深度估计等任务上达到S
这篇工作最值得看的点是什么?在语义分割(COCO、PASCAL-VOC、ADE20K)、深度估计(NYUv2)和深度图上采样(Middlebury)上均取得最优或接近最优性能,且推理速度远快于现有TTO方法
这篇工作的边界或风险在哪里?优点:无需训练、跨架构/跨模态通用、速度快、边缘保持效果好、可扩展到3D特征;缺点:在低信噪比或严重噪声输入下优化不稳定,可能过拟合噪声
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种轻量级测试时优化框架,通过逐像素学习各向异性高斯核参数(空间与范围线索),实现无需训练、跨架构与跨模态的通用特征上采样。

实验合理度:★★★★☆

mIoU, Accuracy(分割);RMSE, δ1(深度);Mean, Median, <11.25°, <22.5°, <30°(表面法线)

学术研究价值:★★★★☆

提出一种轻量级测试时优化框架,通过逐像素学习各向异性高斯核参数(空间与范围线索),实现无需训练、跨架构与跨模态的通用特征上采样;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

224×224图像约0.419秒/张(50次迭代优化)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:在低信噪比或严重噪声输入下优化不稳定,可能过拟合噪声

主要参考文献

[1] Seo M, Hamilton M, Kim C. Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling[J]. arXiv preprint arXiv:2511.16301, 2025.
[2] Fu S, Hamilton M, et al. FeatUp: A Model-Agnostic Framework for Features at Any Resolution[C]. ICLR, 2024.
[3] Kopf J, Cohen M F, Lischinski D, et al. Joint Bilateral Upsampling[J]. ACM Transactions on Graphics (SIGGRAPH), 2007.
[4] Kerbl B, Kopanas G, Leimkühler T, et al. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[C]. SIGGRAPH, 2023.
[5] 项目主页: https://seominseok0429.github.io/Upsample-Anything/

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
涨点不用愁,上采样不用愁!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,群里天天聊SOTA聊涨点,就差你啦~
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。