← 返回 PaperDaily
视觉与图像
北大东北大学最新CoInS-Net:医学插值分割一步到位,PSNR最高涨1.67dB
医学影像里,插值和分割各干各的,就像分手后非要各自忙活,结果边界糊了、病灶漏了。这篇论文让两个任务在一套网络里双向打配合,四个数据集上插值PSNR最高涨1.67dB、分割Dice最高涨2.9个百分点,推理还省了一半时间,临床落地够实在。
龙哥读论文
发布于 2026-09-05 00:31:09
阅读 5
查看原文
原论文信息如下:
龙哥导读:医学影像里,插值和分割各干各的,就像分手后非要各自忙活,结果边界糊了、病灶漏了。这篇论文让两个任务在一套网络里双向打配合,四个数据集上插值PSNR最高涨1.67dB、分割Dice最高涨2.9个百分点,推理还省了一半时间。今天就来聊聊,CoInS-Net是怎么做到的。 医学影像分析的新突破:插值与分割的协同进化
临床CT、MRI数据通常是高度各向异性的:层面内分辨率高,但层间间距大,z轴方向采样稀疏。这种特性导致器官边界、细小结构和病灶在相邻层之间出现模糊、位移甚至不连续。传统做法不外乎两类:一类是串行辅助,也就是先插值后分割,但这样插值过程的错误会直接传递给分割阶段,且分割无法反馈修正插值;另一类是共享网络但特征直接拼接或级联,这种做法容易引入任务不相关信息,造成负迁移。
东北大学与北京大学联合团队提出的CoInS-Net,则是在共享Swin Transformer编码器的基础上,通过连续空间坐标查询、原型级双向交互和多尺度任务协同解码,真正把两个任务捏成了“一个整体”。接下来,龙哥带大家拆解这套框架的两大核心设计。
连续位置感知:从固定间隔到任意位置预测
传统视频插帧模型通常面向固定的时间间隔,比如在第1帧和第2帧之间均匀插入一个或几个中间帧。但医学影像完全不同:不同医院、不同患者的CT/MRI扫描协议,层间距可能是1毫米、3毫米、5毫米甚至更厚。同样一个“相对位置0.5”,在不同数据下对应的实际解剖变化量天差地别。
为此,论文设计了物理位置感知特征生成器(PPA-IFG) 。先看它如何构造位置条件。给定两个端点切片I₀和I₁,物理深度分别为z₀和z₁,目标位置t的定义是归一化后的相对位置:t = (z_t − z₀) / (z₁ − z₀),t∈(0,1)。同时,论文引入归一化间距比率ρ = |z₁ − z₀| / s_xy,其中s_xy是面内像素间距的平均值。
这个位置编码里藏着不少细节。t和1−t分别表示目标位置到两个端点的距离;t(1−t)是一个在中间最大、两端为零的抛物线项,用来衡量非线性修正的强度——离哪个端点越远,非线性变化越需要被建模。log(1+ρ)把物理间距压缩到可学习的动态范围。整套编码由MLP融合成位置token,相当于告诉网络“我现在在什么位置、两层之间物理上隔了多远”。
特征生成分三个层次。首先是线性锚定(Linear Position Anchor):B_t = (1−t)·F₀ + t·F₁,这种线性混合能表达缓慢变化的解剖结构,但无法应对器官的出现、消失、分叉这类非线性结构演化。因此第二步是双端局部聚合——让目标位置特征通过局部窗口注意力,分别从两个端点的邻域收集结构信息。打分时除了常规的查询键相似度,还加入了一个与位置相关的对数偏置log(w_s + ε),w₀=1−t、w₁=t,这样注意力会天然偏向距离更近的端点,用位置先验约束特征融合的方向。
最终,位置感知特征P_t^l = B_t^l + t(1−t)·Φ_A([A_t^l, B_t^l, F₁−F₀, e_t])。这里的关键是,所有非线性修正都要乘以门控t(1−t)。当t=0或t=1时,门控归零,输出严格等于端点特征P₀=F₀、P₁=F₁,端点在数学上可以完美恢复。这个设计让模型只学习“线性混合遗漏的那部分残差”,压力小,稳定性高。
原型交互机制:任务间的智能信息交换
如果说PPA-IFG解决了“位置连续”的问题,那么跨任务原型交互模块(CTPI) 解决的就是“信息怎么交换”的问题。先给不熟悉的读者解释一下什么是原型 ——原型可以理解成每个语义类别在特征空间里的“代表向量”,相当于该类别特征的加权平均。
CTPI的具体做法是:先由分割分支的中间特征生成一个粗略的类别概率图Q^l,然后用这个概率作为权重,分别在分割特征和插值特征上做加权池化。这样会在分割分支得到一个“语义原型”p_S,c,在插值分支得到一个“外观原型”p_I,c。语义原型抓住的是类别身份和判别结构,外观原型抓住的是灰度分布、纹理和形态特征。两个原型进一步拼接并逐元素相乘,融合成“跨任务联合原型”m_c——拼接保留互补信息,逐元素乘则凸显两个任务共同激活的通道。
有了联合原型,双向交互就顺理成章了。分割→插值方向:插值特征中的每个位置,用余弦相似度去查分割语义原型,得到“这个位置属于哪一类”的语义亲密度,再从联合原型中加权聚合出增强特征。这样插值分支就获得了“这里应该是器官边界还是病灶区域”的解剖学提示,在组织界面处不容易过度平滑,也避免了跨区域的不合理混合。
插值→分割方向恰好对称:分割特征去查询插值外观原型,把“两层之间的纹理过渡”“结构变形趋势”这些信息反馈给分割分支,帮助低对比度区域的类别识别和边界定位。这个双向设计非常聪明——它把跨任务信息交换的粒度控制在“类别级”,而不是像素级,既避免了全像素交叉注意力的二次方复杂度,又让信息传递有了可解释性:每个位置最终聚合的是与自身语义类别最匹配的原型特征。
除了CTPI,解码端还有一个多尺度任务协同解码器(MTC-Decoder)。它在每个上采样尺度上,先把两个分支的解码特征合并成一个轻量的共享协作特征C^l,然后每个分支结合自身上采样特征、来自PPA-IFG的跳跃连接、以及这个共享协作特征,用独立参数的卷积块解码。这样既保持了细节通道的通畅,又在不增加额外边界标注的前提下,让两个分支在空间细节上保持默契。论文还设计了一个“空间亲和一致性约束”,通过让插值特征和分割输出的局部亲和矩阵对齐,进一步强化边界的一致性。
实验验证:四个数据集上的全面超越
方法讲完,要看疗效。论文在四个公开医学影像数据集上做了验证:MSD Heart(心脏MRI)、MSD Pancreas(胰腺CT)、AMOS2022(腹部CT/MRI)、BraTS2024(脑肿瘤MRI)。这四个数据集覆盖两种模态、多个解剖区域,数据分布差异很大,能比较充分地检验方法的普适性。
先看插值性能。表1展示了四个数据集上的插值指标对比(PSNR/SSIM):
可以看到,CoInS-Net在全部四个数据集上的PSNR和SSIM都超过已有的专用插值方法。相比最优插值基线,PSNR提升了1.12到1.67 dB,这个幅度在医学影像插值领域相当可观。值得注意的是,在结构复杂度最高的BraTS脑肿瘤数据上,PSNR增益反而最大(1.67 dB),说明原型交互带来的语义约束对复杂结构特别有效。
再看分割性能。表2给出了四个数据集上的分割Dice、Recall等指标:
相比最优分割基线,CoInS-Net在Dice上提升了1.8到2.9个百分点。尤其值得注意的是,CoInS-Net与单独训练的最优分割模型相比,没有额外增加任何分割标注数据,单纯靠插值分支的结构信息就让分割精度上了一个台阶。这说明“用层间变化辅助语义定位”这条路是走得通的。
论文还按器官做了细分统计(表3)。在AMOS2022上,相较各任务的最优基线,CoInS-Net在多数器官上的分割Dice都有提升,其中一些对比度较低的器官提升幅度更大。这说明原型的类别级交互确实把信息用在了刀刃上。图3展示了四个数据集上的定性对比:CoInS-Net插值出的图像更锐利、结构更连续,分割边界也更贴合解剖结构。
为了检验方法的鲁棒性,论文还做了不同z轴采样间距和不同插值位置的实验。在2 mm到16 mm的层间距范围内,CoInS-Net的优势始终存在;在插值位置0.2、0.33、0.5、0.66下同样保持领先。进一步验证了连续位置建模的泛化能力,也为实际临床中“不同扫描协议、不同层间距”的复杂情况提供了保障。
消融实验也做得很完整(表10)。去掉PPA-IFG中的物理间距感知、去掉CTPI、去掉空间亲和一致性约束,性能都有不同程度下降。其中去掉CTPI造成的性能下降最明显,说明原型交互是整套方法的核心。表11还比较了不同的多任务学习架构,验证了原型交互相比直接共享、普通注意力融合的优势。
效率与精度兼得:临床部署的新选择
一个很有吸引力的实际收益是计算效率。由于采用共享编码器,两个任务不再需要各自独立的特征提取链路。与“先插值、后分割”的分步式流程相比,CoInS-Net在一次前向传播中同时输出中间层图像和对应分割结果,推理延迟减少了将近一半。表13给出了MSD Heart上的计算效率对比。
这意味着在临床部署中,一张常规GPU就能同时完成中间层重建和病灶分割,响应时间接近实时。医生在浏览多序列MRI时,可以一边看插值重建的连续切片影像,一边叠加显示对应的病灶分割轮廓,诊断效率更高。更关键的是,中间层的分割结果可以平滑地联动显示,帮助医生直观理解病灶在三维空间中的形态变化——这对术前规划和放疗靶区勾画都有实际价值。
从泛化能力来看,由于方法不依赖特定的成像模态或解剖部位,只要提供两个相邻切片,就能在任意相对位置同时输出图像和分割结果。这意味着它不仅能用于CT/MRI的稠密重建,还可以扩展到超声、病理切片等其他医学影像的二维切片补全和结构分析。当然,论文目前的验证主要围绕肿瘤和器官分割,对于更加细小的血管或神经纤维结构,原型类别的粒度需要进一步细化,这也是后续研究可以深入的方向。
龙迷三问
这篇论文到底在解决什么问题? CoInS-Net是东北大学与北京大学联合提出的连续位置感知多任务网络,针对稀疏各向异性医学体数据,联合完成任意位置切片插值与病灶分割。在四个公开数据集上PSNR最高提升1.67dB、Dice提升2.9个百分点,推理耗时近乎减半。
这篇工作最值得看的点是什么? 在四个数据集上全面超越所有单任务基线,插值PSNR提升1.12-1.67dB,分割Dice提升1.8-2.9个百分点,推理延迟降低近一半。
这篇工作的边界或风险在哪里? 优点:1) 提出连续位置感知的联合插值-分割框架,实现任意位置同步预测;2) 基于原型的双向交互机制避免密集特征混合,计算高效;3) 无需额外边界标注即可增强边界细节;4) 在四个数据集上全面超越现有方法。缺点:1) 依赖Swin Transformer,计算量仍较大;2) 原型交互在类别较多时可能面临扩展性问题;3) 对极端稀疏采样(16mm以上)的性能下降仍需进一步验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一种连续位置感知交互网络CoInS-Net,通过共享Swin编码器、空间连续位置插值模块和基于原型的任务互交互模块,实现医学图像插值和分割的端到端联合优化。
实验合理度: ★★★★☆
PSNR、SSIM、Dice Coefficient、Recall
学术研究价值: ★★★★☆
提出一种连续位置感知交互网络CoInS-Net,通过共享Swin编码器、空间连续位置插值模块和基于原型的任务互交互模块,实现医学图像插值和分割的端到端联合优化;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
118.23G FLOPs,推理时间37.70ms/帧,53.09 FPS,42.98M参数,GPU内存408.92MB。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 标注即可增强边界细节;4) 在四个数据集上全面超越现有方法。缺点:1) 依赖Swin Transformer,计算量仍较大;2) 原型交互在类别较多时可能面临扩展性问题;
主要参考文献
[1] Sun Y, Que N, Shi P, et al. CoInS-Net: A Continuous Position-Aware Network for Joint Medical Image Interpolation and Segmentation[J]. arXiv preprint arXiv:2608.09391, 2026.
[2] Liu Z, Lin Y, Cao Y, et al. Swin Transformer: Hierarchical Vision Transformer using Shifted Windows[C]. ICCV, 2021.
[3] 原论文全文链接:https://arxiv.org/pdf/2608.09391v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
看完了插值和分割互相成就的漂亮戏法,是不是也想在专业圈子里找同好?欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群