← 返回 PaperDaily 视觉与图像

热那亚大学最新研究:轻量分割提精度不靠骨干,靠解码器?

大家都在卷骨干网络,可热那亚大学这篇论文偏偏告诉你:轻量分割模型的涨点空间其实藏在被忽视的分割头里。本文系统对比三种解码器模块、验证多任务层次分解的有效性,参数量比基线少约40%,加权精度反而从91.2%涨到92.8%。把解码器这口“冷饭”炒出了新味道,值得一读。

原论文信息如下:
论文标题:
Lightweight neural networks for affordance segmentation: enhancement of the decoder module
发表日期:
2026年07月(arXiv 2607.29473v1)

发表单位:
意大利热那亚大学(University of Genoa)DITEN系

原文链接:
https://arxiv.org/pdf/2607.26393v1.pdf

先抛一个问题:给机器人装上一只“看得懂”的假肢,需要多大的神经网络?答案很扎心——既想要大模型的聪明脑瓜,又只有单片机级别的算力,这日子没法过了。
可操作性分割(Affordance Segmentation)就是让机器看懂“这个杯子哪里能抓、那个瓶子哪里能拧”的技术。注意,不是认出“这是个杯子”就完事了,而是要把物体拆成功能性部件:杯身、杯把、杯口……每一块都有不同的“操作含义”。这种精细理解需要很强的抽象能力,而抽象能力恰恰是轻量网络的短板。于是尴尬的局面出现了:大模型跑不动,小模型不聪明,可穿戴机器人(假肢、外骨骼)的嵌入式芯片在角落里瑟瑟发抖。
以往大家怎么解决?拼命调骨干网络。网络结构搜索(NAS)、轻量卷积、知识蒸馏……各种招数轮番上阵,目标只有一个:在有限算力里挤出更多精度。但热那亚大学的团队却在论文里提出了一个反直觉的观点:真正被忽视的,可能是分割头(Segmentation Head)这个“小角色”。骨干网络固然重要,但解码头怎么设计、怎么连接、怎么组织多任务,同样能决定轻量模型的天花板。

轻量网络的分割头一直被忽视?

先说结论:
先说结论:分割头(Segmentation Head)的设计,对轻量模型整体性能的影响,比以往大家以为的要大得多。这篇论文用一套系统的实验证明了:仅仅更换分割头的基本模块、调整上采样方式、重新组织多任务结构,参数量从5.9M降到最低1.1M,加权精度反而从91.2%最高涨到92.8%。辛苦调骨干网络调半天,不如回头看看自家解码器——这个思路确实有点意思。
先补一个背景知识。这里说的分割头,指的是分割网络里负责把骨干网络提取的特征图“翻译”成最终分割结果的那部分结构,也叫解码器(Decoder)。骨干网络负责“看”,分割头负责“画”。大模型骨干强、特征好,分割头随便搭搭也能出效果;但轻量模型的特征表达能力本来就有限,分割头如果设计得太简陋,有限的特征就被白白浪费了。这就好比食材本身就一般,厨师的手艺就成了决定性因素。

三种模块×两种上采样:分割头设计空间探索

论文先对分割头的功能做了拆解。分割头主要干两件事:第一件是几何信息重建,把骨干网络输出的低分辨率特征图逐步放大回原始输入分辨率。第二件是逐像素分类,在放大后的特征上判断每个像素属于哪个可操作性部件。
几何信息重建有两条主流技术路线。一条是标准上采样,比如双线性插值或最近邻插值。这类操作不引入可学习参数,只是按照固定规则把特征图“撑大”,计算开销极低,但学不到任何高级的重建模式。另一条是转置卷积(Transposed Convolution),也叫反卷积,本质上是一种卷积核参数可学习的上采样操作。它能让网络自己去学“怎么放大特征图效果更好”,表达能力更强,但也会引入大量额外的FLOPs(浮点运算次数),对轻量设备不够友好。
最后的分类步骤通常交给几层卷积来完成。标准卷积的表达能力不错,但参数量和计算量偏大;深度可分离卷积(Depthwise Separable Convolution)则是把卷积拆成逐通道卷积和逐点卷积两步,能在保持不错精度的同时大幅降低计算成本,特别适合嵌入式场景。
基于这两类上采样和三类卷积模块,论文设计了三种基础分割头模块,对应三种设计取舍:

模块U:深度可分离卷积+最近邻上采样。最省参数的组合,整个分割头只有1.3M参数,适合计算资源极端受限的场景。

模块T:深度可分离卷积+转置卷积。想用更多计算量换取更强的特征重建能力,T就是那个“加钱上高配”的选项,参数量2.0M。

模块B:标准卷积+最近邻上采样。可学习参数比U多一些,但保留了标准卷积的强表达能力,参数量2.2M。

图1展示了论文提出的分割头总体架构。需要注意的是,在多任务设定下,网络会同时输出两条分支:物体分割分支(OS)和可操作性分割分支(VAS)。如果是单任务模式,去掉物体分割分支即可。分割头与骨干网络的连接位置,决定了它能看到哪些层级的特征信息,这也是论文后面的研究重点之一。
图1:论文提出的分割头的总体架构方案
论文把所有分割头都接到了MobileNetV3骨干上,并用FLOPs作为硬性约束条件。表1给出了不同单头和双头组合在三个测试集上的加权精度结果。单头解码器U和T都拿到了92.6%的TOT加权精度,超越了基线的91.2%;而双头组合中TB(模块T做物体分割、模块B做可操作性分割)拿到了92.8%的最高分。注意,基线的参数量是5.9M,而U和T分别只有1.3M和2.0M——少了一大半参数,精度反而更高。
*表格超出部分左右可以滑动
解码器 TOT IIT UMD 参数量
B(单头)91.888.694.62.2M
U(单头)92.691.094.61.3M
T(单头)92.690.595.12.0M
BB(双头)92.589.995.63.6M
UU(双头)92.189.694.91.6M
TT(双头)92.590.395.22.1M
TB(双头)92.890.895.23.6M
UB(双头)91.790.395.23.3M
基线[8]91.288.694.65.9M
表1:可操作性分割性能对比(数值越高越好,TOT为加权综合精度)
这里有个值得注意的细节:所有测试的分割头,无论单头还是双头,加权精度都超过了基线。基线的设计策略来自论文[8](Ragusa等人2021年在IEEE Access上提出的硬件感知可操作性检测方案,即本文的直接对比对象),它更倾向于利用高层语义特征,并且连接方式也与新方案不同。新方案虽然参数量大幅减少,却通过更合理的模块组合把精度反超了。这说明,在轻量模型场景下,分割头的设计空间确实还藏着不少可挖掘的余地。

多任务层次化分解:物体分割如何为可操作性分割“打辅助”?

可操作性分割有一个常被忽略的难点:想要判断“杯把可以抓握”,首先得知道“杯把在哪里、杯子在哪里”。物体的定位是理解部件功能的前提。简单说,网络得先认出物体本身,才能谈得上去分析物体的部件。这对大模型来说可能不是问题,但对轻量模型来说,“同时做定位和部件划分”两件事容易互相干扰。骨干网络的特征一旦混杂了太多背景信息,部件的分割精度就会下降。
论文的思路是把这个任务层级化地拆开:网络同时输出两个分支,共享同一个骨干网络。第一个分支负责二元物体分割任务(Object Segmentation,OS),只区分物体和背景;第二个分支才是真正要解决的可操作性分割任务(Visual Affordance Segmentation,VAS)。物体分割分支的输出会引导第二个分支的输入表征,让可操作性分割分支专注于物体区域内部的部件特征,从而减少背景干扰。整个损失函数就是两个任务的损失之和:
L = Lseg + Laff
其中Lseg对应物体分割任务的损失,Laff对应可操作性分割任务的损失。两个任务联合训练,物体分割分支学会精确定位物体,可操作性分割分支则在一个被“裁剪”到物体区域的特征表示上继续解析部件。这种先“圈出物体”、再“分析部件”的两阶段逻辑,用大白话说就是:先找到杯子,再看杯子哪里能抓。
这种思路类似《多任务学习》中常见的任务分解策略:大任务拆成小任务,小任务之间共享底层特征、各司其职,最终整体精度反而比端到端一把梭更高。表2给出了物体分割任务本身的成绩,所有双头架构在IIT、UMD和替换背景的UMD B三个测试集上的物体分割准确率都超过了90%。这个辅助任务完成得相当扎实,说明它对可操作性分割的“打辅助”是有可靠基础的。
*表格超出部分左右可以滑动
解码器 TOT IIT UMD UMD B
BB92.790.295.495.0
UU93.190.296.095.9
TT93.791.396.296.1
TB93.991.896.296.0
表2:物体分割任务的性能表现(数值越高越好,UMD B为替换背景后的增强测试集)
有一点要说明:论文里并没有专门做一组“关掉物体分割分支”的消融实验来量化多任务带来的独立增益,所以从严格实验设计的角度看,多任务到底贡献了多少提升,暂时只能通过整体对比推断,缺少精确测量。这是实验设计上的一个小遗憾,但不影响整体结论的方向——多任务层级化分解带来的效果在整体指标上确实优于单任务。

连接方式比想象中更重要:从高层语义到低层细节

分割头从骨干网络哪些层“取货”,是另一个容易被忽略的设计维度。骨干网络不同层级的特征图分辨率不同、语义丰富程度不同:浅层特征分辨率高但语义弱,包含更多边缘、纹理等细节;深层特征分辨率低但语义强,包含更多类别层面的抽象信息。
论文在第三组实验里设计了一个很有意思的对比:把原来的一组连接配置(包含8×8超低分辨率特征)替换成另一组配置(把64×64分辨率特征接入分割头),同时移除8×8连接,保持连接总数不变的情况下观察性能变化。具体来说,用64×64特征与16×16、32×32特征一起组成四级特征金字塔,替代原来以8×8、16×16、32×32为主的组合。结果用“-X”后缀标记的新版本参数量全部下降(-0.6M到-1.8M不等),其中UT-X架构的TOT从91.2%涨到92.7%(+1.5),IIT单项从88.1%涨到90.5%(+2.4),效果相当明显。UT-X的参数量只有1.1M,比原来的1.7M减少了35%。
*表格超出部分左右可以滑动
解码器 TOT IIT UMD 参数量
UT-X92.7 (+1.5)90.5 (+2.4)95.4 (+0.7)1.1M (-0.6M)
TU-X92.6 (+0.5)90.7 (+1.5)94.9 (-0.6)1.4M (-0.6M)
TT-X92.6 (+0.1)90.5 (+0.2)95.1 (-0.1)1.5M (-0.6M)
TB-X92.6 (-0.2)90.5 (-0.3)95.3 (+0.1)1.8M (-1.8M)
BB-X92.5 (+0.0)90.3 (+0.4)95.1 (-0.5)1.8M (-1.8M)
表3:使用低层特征图连接后的VAS性能(括号内为与上一版本相比的差值)
不过,替换连接方式后的结果并不是全面占优。比如TB-X反而比之前略微下降了0.2个点,BB-X几乎持平。这说明连接方式的选择没有“绝对最优”,不同模块组合对低层特征的利用效率不一样。论文据此指出,分割头与骨干之间的连接方式应该被当作一个关键的设计因子——在未来自动化设计策略(比如网络结构搜索)中,连接配置应当和模块选择一起被纳入搜索空间。这也提醒读者:分割头不是一个孤立组件,它和骨干网络之间的“接口设计”本身就是一条值得优化的工作流。

实验复盘:几乎全面超越baseline,但仍有遗憾

论文的实验设计涵盖了三个维度:分割头模块类型、任务分解策略、骨干连接位置。数据集用的是两个公开基准:UMD数据集(28,843张RGB-D图像,7类物体,5,135张测试图像)和IIT数据集(8,835张图像,多种拍摄角度和分辨率)。按照文献[8]的设定,所有可抓取的可操作性被合并成一个类别,其余统归为“不可抓取”类,这个简单的二分类设定让评估更加聚焦于分割任务本身。
从方法角度看,实验设置有几个值得称道的地方。首先,用FLOPs作为约束条件而不是只比较参数量,这是更贴近实际部署的做法——FLOPs直接影响推理延迟,而且与具体硬件平台无关,作为轻量模型设计的约束指标比参数量更有意义。其次,UMD数据集的背景替换增强(把统一的蓝色背景替换成风格各异的图片)是一个针对性的数据增强策略,迫使模型摆脱对背景的依赖、真正去学习物体本身的特征,这也让UMD B测试集能够检验模型的抗背景干扰能力。最后,用类别加权像素准确率作为评估指标,并且用TOT综合了三个测试集的结果,比单一指标更能反映模型的整体水平。
从结果来看,最突出的发现是U和T两个单头架构的表现。它们都只用了单任务设定,没有多任务辅助,U和T的TOT分别达到92.6%和92.6%,就已经超过了多任务的双头基线(92.5%)。这证明了深度可分离卷积在轻量分割任务中的潜力——深度可分离卷积把标准卷积拆成逐通道卷积和逐点卷积,以极少的参数量实现了接近甚至超越标准卷积的精度,性价比极高。
为什么深度可分离卷积在这里表现得这么好?一个合理的解释是:轻量模型面临的主要问题不是表达能力不足,而是过拟合风险高。参数量更小的卷积模块自带正则化效果,让模型更容易学到泛化特征,而不是死记硬背训练集。当然,这个规律在UMD上也不是完全一致的——B模块(标准卷积)在单头设定下虽然TOT只有91.8%,但在BB双头组合中拿下全表第二的UMD单项95.6%。标准和深度可分离卷积在不同设定下各有千秋,这也说明“哪种模块最好”没有标准答案,需要根据具体任务组合来定。
但实验设计也有明显的局限性。第一,所有实验都只用了MobileNetV3这一种骨干网络,分割头设计的好坏在更轻或更重的骨干上结论是否一致,论文没有验证。第二,输入分辨率固定为128×128,这个分辨率在真实可穿戴设备上确实合理,但对更高输入分辨率(比如256×256)的情况没有讨论。第三,数据集本身只覆盖了7类常见家庭物体,类别增加后的泛化情况未知。第四,论文用FLOPs代替了实际推理时间,但最终设备上的真实延迟还取决于具体芯片的算力、内存带宽和算子优化程度,FLOPs低不等于实际推理一定快。
另外,从涨幅来看,最高92.8%对比基线91.2%,提升约1.6个百分点。这个幅度不算小,但也算不上“惊艳”。不过考虑到参数量大幅下降的同时精度还提升了,这种“性价比式”的涨点,在嵌入式场景里确实是实打实的价值。

总结与展望

这篇论文的价值不在于提出了多么复杂的新结构,而在于重新审视了一个被长期轻视的设计维度。传统研究习惯把精力集中在骨干网络上,认为分割头是“装上去就能用”的附件。这篇论文用系统的实验证明:在轻量模型场景下,分割头的模块选择、上采样方式、多任务组织、骨干连接位置,每一个环节都在切实影响最终精度。这些发现对嵌入式视觉领域的工程实践有直接指导意义——对于一个只有几十毫秒推理预算、几MB内存上限的智能假肢或外骨骼系统来说,1.1M参数+92.7%精度比5.9M参数+91.2%精度要有吸引力得多。
后续值得探索的方向包括:把分割头设计纳入网络结构搜索(NAS)的搜索空间,在更大的数据集和更多骨干网络上验证结论的普适性,以及在真实的嵌入式芯片(如STM32、Jetson Nano)上直接测量端到端延迟来验证FLOPs预算的实际效果。此外,多任务分解的“辅助任务选择”也值得继续做下去,物体分割只是一个例子——如果换成深度估计、边缘检测这类同样与抓取强相关的任务,是不是也能带来类似的提升?这些开放问题给了后续研究不小的想象空间。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1:可操作性分割(Affordance Segmentation)到底是什么意思?和普通语义分割有什么区别?普通语义分割是把图像里的每个像素分类到对应的物体类别,比如“杯子”“桌子”“书本”。可操作性分割更进一步,它要把同一个物体拆成不同的功能部件,比如一个杯子会被分成“杯身”“杯把”“杯口”,每个部件对应不同的操作含义(可抓握、可倒水等)。这种细粒度的功能理解,正是机器人抓取、操作物体所需的高层认知能力。本文特指视觉可操作性分割(Visual Affordance Segmentation,VAS),即仅从图像输入判断物体的功能部件。

Q2:深度可分离卷积和标准卷积的区别是什么?为什么它在轻量模型里这么吃香?标准卷积用一个卷积核同时处理输入特征图的多个通道,计算量等于“输出通道数×输入通道数×卷积核大小×输出特征图尺寸”。深度可分离卷积把它拆成两步:先做逐通道卷积(每个输入通道单独用一个卷积核处理),再做逐点卷积(用1×1卷积把通道信息融合起来)。两步的总计算量大约是标准卷积的九分之一到三分之一(取决于卷积核大小)。论文中的U和T模块都用了深度可分离卷积,结果参数量只有1.3M和2.0M,精度却超过5.9M的基线。

Q3:为什么物体分割任务能帮助可操作性分割任务?多任务学习在这里为什么有效?可操作性分割需要对物体的部件级特征做精细分析,但轻量模型的骨干网络同时承担“识别物体是什么”和“定位物体在哪里”两个任务,很容易顾此失彼。通过多任务层级化分解,物体分割分支专门负责“物体在哪里”这个相对简单的任务,它学到的定位信息会被用来优化可操作性分割分支的输入表征,让后者专注于“物体部件怎么划分”这个更难的任务。两个任务共享骨干网络,既没有增加太多额外计算量,又让每个任务都有了更明确的学习目标。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性:★★★☆☆ 没有提出革命性新模块,但把分割头设计这个被忽视的维度系统梳理了一遍,思路务实、视角新鲜,算是一次“冷饭新炒”式的有价值尝试。

实验合理度:★★★★☆ 三组实验分层递进,数据集和评估指标选择合理,基线对比清晰;扣一星是因为所有实验只用了MobileNetV3一种骨干,缺乏跨骨干验证。

学术研究价值:★★★★☆ 对轻量分割模型的设计原则有明确指导意义,把分割头从“配件”提升到“设计对象”,对后续NAS和其他轻量模型研究有参考价值。

稳定性:★★★★☆ 方法本身不复杂,多任务联合训练的收敛过程比较稳定,没有出现某些GAN式训练的不确定性;但跨数据集的稳定性还需更多验证。

适应性以及泛化能力:★★★☆☆ 只在UMD和IIT两个家用物体数据集上验证,物体类别只有7类,领域限定在桌面抓取场景;换到自动驾驶、室内导航等其他分割场景,结论是否成立还不好说。

硬件需求及成本:★★★★☆ 参数量和FLOPs都控制得很好,最低1.1M参数对嵌入式设备非常友好;但训练时的计算成本论文没有详细讨论,128×128输入分辨率对精度也有一定限制。

复现难度:★★★★☆ 方法设计简单清晰,数据集都是公开的,基础架构MobileNetV3也有现成实现;扣一星是因为论文没有明确是否开源代码,部分实验细节(如双头训练的具体损失权重)需要自己摸索。

产品化成熟度:★★★☆☆ 设计目标直指可穿戴机器人,FLOPs约束和参数量控制都符合嵌入式场景需求;但离产品化还差最后一步——在真实芯片上的端到端延迟实测、功耗测试和机械臂系统联调都尚未进行。

可能的问题:实验仅覆盖MobileNetV3+128×128分辨率,结论的普适性不足;多任务增益缺少精确消融定量分析;精度提升有限,且缺少真实嵌入式硬件上的延迟验证;低层连接实验的结论分析还可再深入。


主要参考文献

[1] Ragusa E, Gianoglio C, Dosen S, et al. Hardware-aware affordance detection for application in portable embedded systems[J]. IEEE Access, 2021, 9: 123178-123193.(论文基线方法出处)
[2] Nguyen A, Kanoulas D, Caldwell D G, et al. Object-based affordances detection with convolutional neural networks and dense conditional random fields[C]//2017 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). IEEE, 2017: 5908-5915.(IIT数据集出处)
[3] Benmeziane H, Maghraoui K E, Ouarnoughi H, et al. A comprehensive survey on hardware-aware neural architecture search[J]. arXiv preprint arXiv:2101.09336, 2021.(NAS综述)
[4] Lugani S, Ragusa E, Zunino R, et al. Lightweight neural networks for affordance segmentation: enhancement of the decoder module[J]. arXiv preprint arXiv:2607.29473v1, 2026.(本文原文)

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
分割头虽小,涨点不少;可穿戴落地,还得看这套。欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,一起聊点真东西~
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。