← 返回 PaperDaily
视觉与图像
热那亚大学最新研究:轻量分割提精度不靠骨干,靠解码器?
大家都在卷骨干网络,可热那亚大学这篇论文偏偏告诉你:轻量分割模型的涨点空间其实藏在被忽视的分割头里。本文系统对比三种解码器模块、验证多任务层次分解的有效性,参数量比基线少约40%,加权精度反而从91.2%涨到92.8%。把解码器这口“冷饭”炒出了新味道,值得一读。
龙哥读论文
发布于 2026-09-05 00:31:10
阅读 5
查看原文
原论文信息如下:
先抛一个问题:给机器人装上一只“看得懂”的假肢,需要多大的神经网络?答案很扎心——既想要大模型的聪明脑瓜,又只有单片机级别的算力,这日子没法过了。
可操作性分割(Affordance Segmentation)就是让机器看懂“这个杯子哪里能抓、那个瓶子哪里能拧”的技术。注意,不是认出“这是个杯子”就完事了,而是要把物体拆成功能性部件:杯身、杯把、杯口……每一块都有不同的“操作含义”。这种精细理解需要很强的抽象能力,而抽象能力恰恰是轻量网络的短板。于是尴尬的局面出现了:大模型跑不动,小模型不聪明,可穿戴机器人(假肢、外骨骼)的嵌入式芯片在角落里瑟瑟发抖。
以往大家怎么解决?拼命调骨干网络。网络结构搜索(NAS)、轻量卷积、知识蒸馏……各种招数轮番上阵,目标只有一个:在有限算力里挤出更多精度。但热那亚大学的团队却在论文里提出了一个反直觉的观点:真正被忽视的,可能是分割头(Segmentation Head)这个“小角色” 。骨干网络固然重要,但解码头怎么设计、怎么连接、怎么组织多任务,同样能决定轻量模型的天花板。
轻量网络的分割头一直被忽视?
先说结论:先说结论:分割头(Segmentation Head)的设计,对轻量模型整体性能的影响,比以往大家以为的要大得多。 这篇论文用一套系统的实验证明了:仅仅更换分割头的基本模块、调整上采样方式、重新组织多任务结构,参数量从5.9M降到最低1.1M,加权精度反而从91.2%最高涨到92.8%。辛苦调骨干网络调半天,不如回头看看自家解码器——这个思路确实有点意思。
先补一个背景知识。这里说的分割头,指的是分割网络里负责把骨干网络提取的特征图“翻译”成最终分割结果的那部分结构,也叫解码器(Decoder)。骨干网络负责“看”,分割头负责“画”。大模型骨干强、特征好,分割头随便搭搭也能出效果;但轻量模型的特征表达能力本来就有限,分割头如果设计得太简陋,有限的特征就被白白浪费了。这就好比食材本身就一般,厨师的手艺就成了决定性因素。
三种模块×两种上采样:分割头设计空间探索
论文先对分割头的功能做了拆解。分割头主要干两件事:第一件是几何信息重建 ,把骨干网络输出的低分辨率特征图逐步放大回原始输入分辨率。第二件是逐像素分类 ,在放大后的特征上判断每个像素属于哪个可操作性部件。
几何信息重建有两条主流技术路线。一条是标准上采样 ,比如双线性插值或最近邻插值。这类操作不引入可学习参数,只是按照固定规则把特征图“撑大”,计算开销极低,但学不到任何高级的重建模式。另一条是转置卷积(Transposed Convolution) ,也叫反卷积,本质上是一种卷积核参数可学习的上采样操作。它能让网络自己去学“怎么放大特征图效果更好”,表达能力更强,但也会引入大量额外的FLOPs(浮点运算次数),对轻量设备不够友好。
最后的分类步骤通常交给几层卷积来完成。标准卷积的表达能力不错,但参数量和计算量偏大;深度可分离卷积(Depthwise Separable Convolution)则是把卷积拆成逐通道卷积和逐点卷积两步,能在保持不错精度的同时大幅降低计算成本,特别适合嵌入式场景。
基于这两类上采样和三类卷积模块,论文设计了三种基础分割头模块,对应三种设计取舍:
模块U: 深度可分离卷积+最近邻上采样。最省参数的组合,整个分割头只有1.3M参数,适合计算资源极端受限的场景。
模块T: 深度可分离卷积+转置卷积。想用更多计算量换取更强的特征重建能力,T就是那个“加钱上高配”的选项,参数量2.0M。
模块B: 标准卷积+最近邻上采样。可学习参数比U多一些,但保留了标准卷积的强表达能力,参数量2.2M。
图1展示了论文提出的分割头总体架构。需要注意的是,在多任务设定下,网络会同时输出两条分支:物体分割分支(OS)和可操作性分割分支(VAS)。如果是单任务模式,去掉物体分割分支即可。分割头与骨干网络的连接位置,决定了它能看到哪些层级的特征信息,这也是论文后面的研究重点之一。
论文把所有分割头都接到了MobileNetV3骨干上,并用FLOPs作为硬性约束条件。表1给出了不同单头和双头组合在三个测试集上的加权精度结果。单头解码器U和T都拿到了92.6%的TOT加权精度,超越了基线的91.2%;而双头组合中TB(模块T做物体分割、模块B做可操作性分割)拿到了92.8%的最高分。注意,基线的参数量是5.9M,而U和T分别只有1.3M和2.0M——少了一大半参数,精度反而更高。
*表格超出部分左右可以滑动
解码器
TOT
IIT
UMD
参数量
B(单头) 91.8 88.6 94.6 2.2M
U(单头) 92.6 91.0 94.6 1.3M
T(单头) 92.6 90.5 95.1 2.0M
BB(双头) 92.5 89.9 95.6 3.6M
UU(双头) 92.1 89.6 94.9 1.6M
TT(双头) 92.5 90.3 95.2 2.1M
TB(双头) 92.8 90.8 95.2 3.6M
UB(双头) 91.7 90.3 95.2 3.3M
基线[8] 91.2 88.6 94.6 5.9M
表1:可操作性分割性能对比(数值越高越好,TOT为加权综合精度)
这里有个值得注意的细节:所有测试的分割头,无论单头还是双头,加权精度都超过了基线。基线的设计策略来自论文[8](Ragusa等人2021年在IEEE Access上提出的硬件感知可操作性检测方案,即本文的直接对比对象),它更倾向于利用高层语义特征,并且连接方式也与新方案不同。新方案虽然参数量大幅减少,却通过更合理的模块组合把精度反超了。这说明,在轻量模型场景下,分割头的设计空间确实还藏着不少可挖掘的余地。
多任务层次化分解:物体分割如何为可操作性分割“打辅助”?
可操作性分割有一个常被忽略的难点:想要判断“杯把可以抓握”,首先得知道“杯把在哪里、杯子在哪里”。物体的定位是理解部件功能的前提。简单说,网络得先认出物体本身,才能谈得上去分析物体的部件。这对大模型来说可能不是问题,但对轻量模型来说,“同时做定位和部件划分”两件事容易互相干扰。骨干网络的特征一旦混杂了太多背景信息,部件的分割精度就会下降。
论文的思路是把这个任务层级化地拆开:网络同时输出两个分支,共享同一个骨干网络。第一个分支负责二元物体分割任务(Object Segmentation,OS),只区分物体和背景;第二个分支才是真正要解决的可操作性分割任务(Visual Affordance Segmentation,VAS)。物体分割分支的输出会引导第二个分支的输入表征,让可操作性分割分支专注于物体区域内部的部件特征,从而减少背景干扰。整个损失函数就是两个任务的损失之和:
其中Lseg对应物体分割任务的损失,Laff对应可操作性分割任务的损失。两个任务联合训练,物体分割分支学会精确定位物体,可操作性分割分支则在一个被“裁剪”到物体区域的特征表示上继续解析部件。这种先“圈出物体”、再“分析部件”的两阶段逻辑,用大白话说就是:先找到杯子,再看杯子哪里能抓。
这种思路类似《多任务学习》中常见的任务分解策略:大任务拆成小任务,小任务之间共享底层特征、各司其职,最终整体精度反而比端到端一把梭更高。表2给出了物体分割任务本身的成绩,所有双头架构在IIT、UMD和替换背景的UMD B三个测试集上的物体分割准确率都超过了90%。这个辅助任务完成得相当扎实,说明它对可操作性分割的“打辅助”是有可靠基础的。
*表格超出部分左右可以滑动
解码器
TOT
IIT
UMD
UMD B
BB 92.7 90.2 95.4 95.0
UU 93.1 90.2 96.0 95.9
TT 93.7 91.3 96.2 96.1
TB 93.9 91.8 96.2 96.0
表2:物体分割任务的性能表现(数值越高越好,UMD B为替换背景后的增强测试集)
有一点要说明:论文里并没有专门做一组“关掉物体分割分支”的消融实验来量化多任务带来的独立增益,所以从严格实验设计的角度看,多任务到底贡献了多少提升,暂时只能通过整体对比推断,缺少精确测量。这是实验设计上的一个小遗憾,但不影响整体结论的方向——多任务层级化分解带来的效果在整体指标上确实优于单任务。
连接方式比想象中更重要:从高层语义到低层细节
分割头从骨干网络哪些层“取货”,是另一个容易被忽略的设计维度。骨干网络不同层级的特征图分辨率不同、语义丰富程度不同:浅层特征分辨率高但语义弱,包含更多边缘、纹理等细节;深层特征分辨率低但语义强,包含更多类别层面的抽象信息。
论文在第三组实验里设计了一个很有意思的对比:把原来的一组连接配置(包含8×8超低分辨率特征)替换成另一组配置(把64×64分辨率特征接入分割头),同时移除8×8连接,保持连接总数不变的情况下观察性能变化。具体来说,用64×64特征与16×16、32×32特征一起组成四级特征金字塔,替代原来以8×8、16×16、32×32为主的组合。结果用“-X”后缀标记的新版本参数量全部下降(-0.6M到-1.8M不等),其中UT-X架构的TOT从91.2%涨到92.7%(+1.5),IIT单项从88.1%涨到90.5%(+2.4),效果相当明显。UT-X的参数量只有1.1M,比原来的1.7M减少了35%。
*表格超出部分左右可以滑动
解码器
TOT
IIT
UMD
参数量
UT-X 92.7 (+1.5) 90.5 (+2.4) 95.4 (+0.7) 1.1M (-0.6M)
TU-X 92.6 (+0.5) 90.7 (+1.5) 94.9 (-0.6) 1.4M (-0.6M)
TT-X 92.6 (+0.1) 90.5 (+0.2) 95.1 (-0.1) 1.5M (-0.6M)
TB-X 92.6 (-0.2) 90.5 (-0.3) 95.3 (+0.1) 1.8M (-1.8M)
BB-X 92.5 (+0.0) 90.3 (+0.4) 95.1 (-0.5) 1.8M (-1.8M)
表3:使用低层特征图连接后的VAS性能(括号内为与上一版本相比的差值)
不过,替换连接方式后的结果并不是全面占优。比如TB-X反而比之前略微下降了0.2个点,BB-X几乎持平。这说明连接方式的选择没有“绝对最优”,不同模块组合对低层特征的利用效率不一样。论文据此指出,分割头与骨干之间的连接方式应该被当作一个关键的设计因子——在未来自动化设计策略(比如网络结构搜索)中,连接配置应当和模块选择一起被纳入搜索空间。这也提醒读者:分割头不是一个孤立组件,它和骨干网络之间的“接口设计”本身就是一条值得优化的工作流。
实验复盘:几乎全面超越baseline,但仍有遗憾
论文的实验设计涵盖了三个维度:分割头模块类型、任务分解策略、骨干连接位置。数据集用的是两个公开基准:UMD数据集(28,843张RGB-D图像,7类物体,5,135张测试图像)和IIT数据集(8,835张图像,多种拍摄角度和分辨率)。按照文献[8]的设定,所有可抓取的可操作性被合并成一个类别,其余统归为“不可抓取”类,这个简单的二分类设定让评估更加聚焦于分割任务本身。
从方法角度看,实验设置有几个值得称道的地方。首先,用FLOPs作为约束条件而不是只比较参数量,这是更贴近实际部署的做法——FLOPs直接影响推理延迟,而且与具体硬件平台无关,作为轻量模型设计的约束指标比参数量更有意义。其次,UMD数据集的背景替换增强(把统一的蓝色背景替换成风格各异的图片)是一个针对性的数据增强策略,迫使模型摆脱对背景的依赖、真正去学习物体本身的特征,这也让UMD B测试集能够检验模型的抗背景干扰能力。最后,用类别加权像素准确率作为评估指标,并且用TOT综合了三个测试集的结果,比单一指标更能反映模型的整体水平。
从结果来看,最突出的发现是U和T两个单头架构的表现 。它们都只用了单任务设定,没有多任务辅助,U和T的TOT分别达到92.6%和92.6%,就已经超过了多任务的双头基线(92.5%)。这证明了深度可分离卷积在轻量分割任务中的潜力——深度可分离卷积把标准卷积拆成逐通道卷积和逐点卷积,以极少的参数量实现了接近甚至超越标准卷积的精度,性价比极高。
为什么深度可分离卷积在这里表现得这么好?一个合理的解释是:轻量模型面临的主要问题不是表达能力不足,而是过拟合风险高。参数量更小的卷积模块自带正则化效果,让模型更容易学到泛化特征,而不是死记硬背训练集。当然,这个规律在UMD上也不是完全一致的——B模块(标准卷积)在单头设定下虽然TOT只有91.8%,但在BB双头组合中拿下全表第二的UMD单项95.6%。标准和深度可分离卷积在不同设定下各有千秋,这也说明“哪种模块最好”没有标准答案,需要根据具体任务组合来定。
但实验设计也有明显的局限性。第一,所有实验都只用了MobileNetV3这一种骨干网络,分割头设计的好坏在更轻或更重的骨干上结论是否一致,论文没有验证。第二,输入分辨率固定为128×128,这个分辨率在真实可穿戴设备上确实合理,但对更高输入分辨率(比如256×256)的情况没有讨论。第三,数据集本身只覆盖了7类常见家庭物体,类别增加后的泛化情况未知。第四,论文用FLOPs代替了实际推理时间,但最终设备上的真实延迟还取决于具体芯片的算力、内存带宽和算子优化程度,FLOPs低不等于实际推理一定快。
另外,从涨幅来看,最高92.8%对比基线91.2%,提升约1.6个百分点。这个幅度不算小,但也算不上“惊艳”。不过考虑到参数量大幅下降的同时精度还提升了,这种“性价比式”的涨点,在嵌入式场景里确实是实打实的价值。
总结与展望
这篇论文的价值不在于提出了多么复杂的新结构,而在于重新审视了一个被长期轻视的设计维度。传统研究习惯把精力集中在骨干网络上,认为分割头是“装上去就能用”的附件。这篇论文用系统的实验证明:在轻量模型场景下,分割头的模块选择、上采样方式、多任务组织、骨干连接位置,每一个环节都在切实影响最终精度。这些发现对嵌入式视觉领域的工程实践有直接指导意义——对于一个只有几十毫秒推理预算、几MB内存上限的智能假肢或外骨骼系统来说,1.1M参数+92.7%精度比5.9M参数+91.2%精度要有吸引力得多。
后续值得探索的方向包括:把分割头设计纳入网络结构搜索(NAS)的搜索空间,在更大的数据集和更多骨干网络上验证结论的普适性,以及在真实的嵌入式芯片(如STM32、Jetson Nano)上直接测量端到端延迟来验证FLOPs预算的实际效果。此外,多任务分解的“辅助任务选择”也值得继续做下去,物体分割只是一个例子——如果换成深度估计、边缘检测这类同样与抓取强相关的任务,是不是也能带来类似的提升?这些开放问题给了后续研究不小的想象空间。
龙迷三问
Q1:可操作性分割(Affordance Segmentation)到底是什么意思?和普通语义分割有什么区别? 普通语义分割是把图像里的每个像素分类到对应的物体类别,比如“杯子”“桌子”“书本”。可操作性分割更进一步,它要把同一个物体拆成不同的功能部件,比如一个杯子会被分成“杯身”“杯把”“杯口”,每个部件对应不同的操作含义(可抓握、可倒水等)。这种细粒度的功能理解,正是机器人抓取、操作物体所需的高层认知能力。本文特指视觉可操作性分割(Visual Affordance Segmentation,VAS),即仅从图像输入判断物体的功能部件。
Q2:深度可分离卷积和标准卷积的区别是什么?为什么它在轻量模型里这么吃香? 标准卷积用一个卷积核同时处理输入特征图的多个通道,计算量等于“输出通道数×输入通道数×卷积核大小×输出特征图尺寸”。深度可分离卷积把它拆成两步:先做逐通道卷积(每个输入通道单独用一个卷积核处理),再做逐点卷积(用1×1卷积把通道信息融合起来)。两步的总计算量大约是标准卷积的九分之一到三分之一(取决于卷积核大小)。论文中的U和T模块都用了深度可分离卷积,结果参数量只有1.3M和2.0M,精度却超过5.9M的基线。
Q3:为什么物体分割任务能帮助可操作性分割任务?多任务学习在这里为什么有效? 可操作性分割需要对物体的部件级特征做精细分析,但轻量模型的骨干网络同时承担“识别物体是什么”和“定位物体在哪里”两个任务,很容易顾此失彼。通过多任务层级化分解,物体分割分支专门负责“物体在哪里”这个相对简单的任务,它学到的定位信息会被用来优化可操作性分割分支的输入表征,让后者专注于“物体部件怎么划分”这个更难的任务。两个任务共享骨干网络,既没有增加太多额外计算量,又让每个任务都有了更明确的学习目标。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性: ★★★☆☆ 没有提出革命性新模块,但把分割头设计这个被忽视的维度系统梳理了一遍,思路务实、视角新鲜,算是一次“冷饭新炒”式的有价值尝试。
实验合理度: ★★★★☆ 三组实验分层递进,数据集和评估指标选择合理,基线对比清晰;扣一星是因为所有实验只用了MobileNetV3一种骨干,缺乏跨骨干验证。
学术研究价值: ★★★★☆ 对轻量分割模型的设计原则有明确指导意义,把分割头从“配件”提升到“设计对象”,对后续NAS和其他轻量模型研究有参考价值。
稳定性: ★★★★☆ 方法本身不复杂,多任务联合训练的收敛过程比较稳定,没有出现某些GAN式训练的不确定性;但跨数据集的稳定性还需更多验证。
适应性以及泛化能力: ★★★☆☆ 只在UMD和IIT两个家用物体数据集上验证,物体类别只有7类,领域限定在桌面抓取场景;换到自动驾驶、室内导航等其他分割场景,结论是否成立还不好说。
硬件需求及成本: ★★★★☆ 参数量和FLOPs都控制得很好,最低1.1M参数对嵌入式设备非常友好;但训练时的计算成本论文没有详细讨论,128×128输入分辨率对精度也有一定限制。
复现难度: ★★★★☆ 方法设计简单清晰,数据集都是公开的,基础架构MobileNetV3也有现成实现;扣一星是因为论文没有明确是否开源代码,部分实验细节(如双头训练的具体损失权重)需要自己摸索。
产品化成熟度: ★★★☆☆ 设计目标直指可穿戴机器人,FLOPs约束和参数量控制都符合嵌入式场景需求;但离产品化还差最后一步——在真实芯片上的端到端延迟实测、功耗测试和机械臂系统联调都尚未进行。
可能的问题: 实验仅覆盖MobileNetV3+128×128分辨率,结论的普适性不足;多任务增益缺少精确消融定量分析;精度提升有限,且缺少真实嵌入式硬件上的延迟验证;低层连接实验的结论分析还可再深入。
[1] Ragusa E, Gianoglio C, Dosen S, et al. Hardware-aware affordance detection for application in portable embedded systems[J]. IEEE Access, 2021, 9: 123178-123193.(论文基线方法出处)
[2] Nguyen A, Kanoulas D, Caldwell D G, et al. Object-based affordances detection with convolutional neural networks and dense conditional random fields[C]//2017 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE, 2017: 5908-5915.(IIT数据集出处)
[3] Benmeziane H, Maghraoui K E, Ouarnoughi H, et al. A comprehensive survey on hardware-aware neural architecture search[J]. arXiv preprint arXiv:2101.09336, 2021.(NAS综述)
[4] Lugani S, Ragusa E, Zunino R, et al. Lightweight neural networks for affordance segmentation: enhancement of the decoder module[J]. arXiv preprint arXiv:2607.29473v1, 2026.(本文原文)
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
分割头虽小,涨点不少;可穿戴落地,还得看这套。欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,一起聊点真东西~