← 返回 PaperDaily 视觉与图像

北大东北大学最新CoInS-Net:医学插值分割一步到位,PSNR最高涨1.67dB

医学影像里,插值和分割各干各的,就像分手后非要各自忙活,结果边界糊了、病灶漏了。这篇论文让两个任务在一套网络里双向打配合,四个数据集上插值PSNR最高涨1.67dB、分割Dice最高涨2.9个百分点,推理还省了一半时间,临床落地够实在。

北大东北大学最新CoInS-Net:医学插值分割一步到位,PSNR最高涨1.67dB
原论文信息如下:
论文标题:
CoInS-Net: A Continuous Position-Aware Network for Joint Medical Image Interpolation and Segmentation
发表日期:
2026年8月
发表单位:
东北大学医学与生物信息工程学院、北京大学未来技术学院(双通讯)
原文链接:
https://arxiv.org/pdf/2608.09391v1.pdf
龙哥导读:医学影像里,插值和分割各干各的,就像分手后非要各自忙活,结果边界糊了、病灶漏了。这篇论文让两个任务在一套网络里双向打配合,四个数据集上插值PSNR最高涨1.67dB、分割Dice最高涨2.9个百分点,推理还省了一半时间。今天就来聊聊,CoInS-Net是怎么做到的。

医学影像分析的新突破:插值与分割的协同进化

表情包
医学影像的计算机辅助分析中,两个基础任务长期扮演重要角色:一个是图像插值,也就是在稀疏扫描的相邻层之间,把缺失的中间切片“补”出来;另一个是图像分割,也就是把病灶、器官等目标结构的轮廓精准勾出来。这两个任务看似独立,实则互补性极强——插值需要分割提供解剖语义约束,避免生成怪异结构;分割需要插值提供层间结构变化线索,帮助定位模糊区域。
临床CT、MRI数据通常是高度各向异性的:层面内分辨率高,但层间间距大,z轴方向采样稀疏。这种特性导致器官边界、细小结构和病灶在相邻层之间出现模糊、位移甚至不连续。传统做法不外乎两类:一类是串行辅助,也就是先插值后分割,但这样插值过程的错误会直接传递给分割阶段,且分割无法反馈修正插值;另一类是共享网络但特征直接拼接或级联,这种做法容易引入任务不相关信息,造成负迁移。
图1:三种交互范式对比
三种交互范式对比。(左)串行辅助范式;(中)常规联合范式;(右)CoInS-Net的受控双向交互范式。
东北大学与北京大学联合团队提出的CoInS-Net,则是在共享Swin Transformer编码器的基础上,通过连续空间坐标查询、原型级双向交互和多尺度任务协同解码,真正把两个任务捏成了“一个整体”。接下来,龙哥带大家拆解这套框架的两大核心设计。

连续位置感知:从固定间隔到任意位置预测

传统视频插帧模型通常面向固定的时间间隔,比如在第1帧和第2帧之间均匀插入一个或几个中间帧。但医学影像完全不同:不同医院、不同患者的CT/MRI扫描协议,层间距可能是1毫米、3毫米、5毫米甚至更厚。同样一个“相对位置0.5”,在不同数据下对应的实际解剖变化量天差地别。
为此,论文设计了物理位置感知特征生成器(PPA-IFG)。先看它如何构造位置条件。给定两个端点切片I₀和I₁,物理深度分别为z₀和z₁,目标位置t的定义是归一化后的相对位置:t = (z_t − z₀) / (z₁ − z₀),t∈(0,1)。同时,论文引入归一化间距比率ρ = |z₁ − z₀| / s_xy,其中s_xy是面内像素间距的平均值。
公式1:目标位置归一化定义
公式1:目标位置归一化定义
公式2:位置编码构造
公式2:位置编码构造。e_t = MLP([t, 1−t, t(1−t), log(1+ρ), γ(t)]),其中γ(t) = [sin(πt), cos(πt), sin(2πt), cos(2πt)],频率刻意限制在低阶谐波,避免在有限医学数据上过拟合。
这个位置编码里藏着不少细节。t和1−t分别表示目标位置到两个端点的距离;t(1−t)是一个在中间最大、两端为零的抛物线项,用来衡量非线性修正的强度——离哪个端点越远,非线性变化越需要被建模。log(1+ρ)把物理间距压缩到可学习的动态范围。整套编码由MLP融合成位置token,相当于告诉网络“我现在在什么位置、两层之间物理上隔了多远”。
特征生成分三个层次。首先是线性锚定(Linear Position Anchor):B_t = (1−t)·F₀ + t·F₁,这种线性混合能表达缓慢变化的解剖结构,但无法应对器官的出现、消失、分叉这类非线性结构演化。因此第二步是双端局部聚合——让目标位置特征通过局部窗口注意力,分别从两个端点的邻域收集结构信息。打分时除了常规的查询键相似度,还加入了一个与位置相关的对数偏置log(w_s + ε),w₀=1−t、w₁=t,这样注意力会天然偏向距离更近的端点,用位置先验约束特征融合的方向。
公式3:位置偏置注意力打分
公式3:位置偏置注意力打分。r_s,δ(x) = q_t^l(x)ᵀk_s,δ(x) / √d + log(w_s + ε) + b_δ,其中b_δ是可学习空间偏置。
最终,位置感知特征P_t^l = B_t^l + t(1−t)·Φ_A([A_t^l, B_t^l, F₁−F₀, e_t])。这里的关键是,所有非线性修正都要乘以门控t(1−t)。当t=0或t=1时,门控归零,输出严格等于端点特征P₀=F₀、P₁=F₁,端点在数学上可以完美恢复。这个设计让模型只学习“线性混合遗漏的那部分残差”,压力小,稳定性高。

原型交互机制:任务间的智能信息交换

如果说PPA-IFG解决了“位置连续”的问题,那么跨任务原型交互模块(CTPI)解决的就是“信息怎么交换”的问题。先给不熟悉的读者解释一下什么是原型——原型可以理解成每个语义类别在特征空间里的“代表向量”,相当于该类别特征的加权平均。
CTPI的具体做法是:先由分割分支的中间特征生成一个粗略的类别概率图Q^l,然后用这个概率作为权重,分别在分割特征和插值特征上做加权池化。这样会在分割分支得到一个“语义原型”p_S,c,在插值分支得到一个“外观原型”p_I,c。语义原型抓住的是类别身份和判别结构,外观原型抓住的是灰度分布、纹理和形态特征。两个原型进一步拼接并逐元素相乘,融合成“跨任务联合原型”m_c——拼接保留互补信息,逐元素乘则凸显两个任务共同激活的通道。
公式4:联合原型构造
公式4:联合原型构造。m_c^l = ψ^l([p_I,c^l, p_S,c^l, p_I,c^l ⊙ p_S,c^l])
有了联合原型,双向交互就顺理成章了。分割→插值方向:插值特征中的每个位置,用余弦相似度去查分割语义原型,得到“这个位置属于哪一类”的语义亲密度,再从联合原型中加权聚合出增强特征。这样插值分支就获得了“这里应该是器官边界还是病灶区域”的解剖学提示,在组织界面处不容易过度平滑,也避免了跨区域的不合理混合。
公式5:分割条件化插值注意力权重
公式5:分割条件化插值注意力权重。α_I,c(x) = Softmax_c∈V(sim(W_q,I^l U_I^l(x), W_k,S^l p_S,c^l) / τ)
插值→分割方向恰好对称:分割特征去查询插值外观原型,把“两层之间的纹理过渡”“结构变形趋势”这些信息反馈给分割分支,帮助低对比度区域的类别识别和边界定位。这个双向设计非常聪明——它把跨任务信息交换的粒度控制在“类别级”,而不是像素级,既避免了全像素交叉注意力的二次方复杂度,又让信息传递有了可解释性:每个位置最终聚合的是与自身语义类别最匹配的原型特征。
除了CTPI,解码端还有一个多尺度任务协同解码器(MTC-Decoder)。它在每个上采样尺度上,先把两个分支的解码特征合并成一个轻量的共享协作特征C^l,然后每个分支结合自身上采样特征、来自PPA-IFG的跳跃连接、以及这个共享协作特征,用独立参数的卷积块解码。这样既保持了细节通道的通畅,又在不增加额外边界标注的前提下,让两个分支在空间细节上保持默契。论文还设计了一个“空间亲和一致性约束”,通过让插值特征和分割输出的局部亲和矩阵对齐,进一步强化边界的一致性。

实验验证:四个数据集上的全面超越

方法讲完,要看疗效。论文在四个公开医学影像数据集上做了验证:MSD Heart(心脏MRI)、MSD Pancreas(胰腺CT)、AMOS2022(腹部CT/MRI)、BraTS2024(脑肿瘤MRI)。这四个数据集覆盖两种模态、多个解剖区域,数据分布差异很大,能比较充分地检验方法的普适性。
图2:CoInS-Net总体框架
图2:CoInS-Net总体框架。共享Swin编码器提取双端点特征,PPA-IFG生成任意位置特征,CTPI执行跨任务原型交互,MTC-Decoder做多尺度协同解码。
先看插值性能。表1展示了四个数据集上的插值指标对比(PSNR/SSIM):
表1:四个医学图像数据集上的插值性能
表1:四个医学图像数据集上的插值性能(粗体为最优,下划线为次优)。
可以看到,CoInS-Net在全部四个数据集上的PSNR和SSIM都超过已有的专用插值方法。相比最优插值基线,PSNR提升了1.12到1.67 dB,这个幅度在医学影像插值领域相当可观。值得注意的是,在结构复杂度最高的BraTS脑肿瘤数据上,PSNR增益反而最大(1.67 dB),说明原型交互带来的语义约束对复杂结构特别有效。
再看分割性能。表2给出了四个数据集上的分割Dice、Recall等指标:
表2:四个医学图像数据集上的分割性能
表2:四个医学图像数据集上的分割性能。
相比最优分割基线,CoInS-Net在Dice上提升了1.8到2.9个百分点。尤其值得注意的是,CoInS-Net与单独训练的最优分割模型相比,没有额外增加任何分割标注数据,单纯靠插值分支的结构信息就让分割精度上了一个台阶。这说明“用层间变化辅助语义定位”这条路是走得通的。
论文还按器官做了细分统计(表3)。在AMOS2022上,相较各任务的最优基线,CoInS-Net在多数器官上的分割Dice都有提升,其中一些对比度较低的器官提升幅度更大。这说明原型的类别级交互确实把信息用在了刀刃上。图3展示了四个数据集上的定性对比:CoInS-Net插值出的图像更锐利、结构更连续,分割边界也更贴合解剖结构。
图3:四个数据集上的定性结果
图3:四个数据集上的定性结果:(a) MSD Heart;(b) MSD Pancreas;(c) AMOS2022;(d) BraTS2024。
为了检验方法的鲁棒性,论文还做了不同z轴采样间距和不同插值位置的实验。在2 mm到16 mm的层间距范围内,CoInS-Net的优势始终存在;在插值位置0.2、0.33、0.5、0.66下同样保持领先。进一步验证了连续位置建模的泛化能力,也为实际临床中“不同扫描协议、不同层间距”的复杂情况提供了保障。
消融实验也做得很完整(表10)。去掉PPA-IFG中的物理间距感知、去掉CTPI、去掉空间亲和一致性约束,性能都有不同程度下降。其中去掉CTPI造成的性能下降最明显,说明原型交互是整套方法的核心。表11还比较了不同的多任务学习架构,验证了原型交互相比直接共享、普通注意力融合的优势。
表10:核心模块消融实验
表10:四个医学图像数据集上的核心模块消融实验。

效率与精度兼得:临床部署的新选择

一个很有吸引力的实际收益是计算效率。由于采用共享编码器,两个任务不再需要各自独立的特征提取链路。与“先插值、后分割”的分步式流程相比,CoInS-Net在一次前向传播中同时输出中间层图像和对应分割结果,推理延迟减少了将近一半。表13给出了MSD Heart上的计算效率对比。
表13:MSD Heart MRI上的计算效率对比
表13:MSD Heart MRI上的计算效率对比。
这意味着在临床部署中,一张常规GPU就能同时完成中间层重建和病灶分割,响应时间接近实时。医生在浏览多序列MRI时,可以一边看插值重建的连续切片影像,一边叠加显示对应的病灶分割轮廓,诊断效率更高。更关键的是,中间层的分割结果可以平滑地联动显示,帮助医生直观理解病灶在三维空间中的形态变化——这对术前规划和放疗靶区勾画都有实际价值。
从泛化能力来看,由于方法不依赖特定的成像模态或解剖部位,只要提供两个相邻切片,就能在任意相对位置同时输出图像和分割结果。这意味着它不仅能用于CT/MRI的稠密重建,还可以扩展到超声、病理切片等其他医学影像的二维切片补全和结构分析。当然,论文目前的验证主要围绕肿瘤和器官分割,对于更加细小的血管或神经纤维结构,原型类别的粒度需要进一步细化,这也是后续研究可以深入的方向。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?CoInS-Net是东北大学与北京大学联合提出的连续位置感知多任务网络,针对稀疏各向异性医学体数据,联合完成任意位置切片插值与病灶分割。在四个公开数据集上PSNR最高提升1.67dB、Dice提升2.9个百分点,推理耗时近乎减半。
这篇工作最值得看的点是什么?在四个数据集上全面超越所有单任务基线,插值PSNR提升1.12-1.67dB,分割Dice提升1.8-2.9个百分点,推理延迟降低近一半。
这篇工作的边界或风险在哪里?优点:1) 提出连续位置感知的联合插值-分割框架,实现任意位置同步预测;2) 基于原型的双向交互机制避免密集特征混合,计算高效;3) 无需额外边界标注即可增强边界细节;4) 在四个数据集上全面超越现有方法。缺点:1) 依赖Swin Transformer,计算量仍较大;2) 原型交互在类别较多时可能面临扩展性问题;3) 对极端稀疏采样(16mm以上)的性能下降仍需进一步验证。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种连续位置感知交互网络CoInS-Net,通过共享Swin编码器、空间连续位置插值模块和基于原型的任务互交互模块,实现医学图像插值和分割的端到端联合优化。

实验合理度:★★★★☆

PSNR、SSIM、Dice Coefficient、Recall

学术研究价值:★★★★☆

提出一种连续位置感知交互网络CoInS-Net,通过共享Swin编码器、空间连续位置插值模块和基于原型的任务互交互模块,实现医学图像插值和分割的端到端联合优化;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

118.23G FLOPs,推理时间37.70ms/帧,53.09 FPS,42.98M参数,GPU内存408.92MB。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:标注即可增强边界细节;4) 在四个数据集上全面超越现有方法。缺点:1) 依赖Swin Transformer,计算量仍较大;2) 原型交互在类别较多时可能面临扩展性问题;

主要参考文献

[1] Sun Y, Que N, Shi P, et al. CoInS-Net: A Continuous Position-Aware Network for Joint Medical Image Interpolation and Segmentation[J]. arXiv preprint arXiv:2608.09391, 2026.
[2] Liu Z, Lin Y, Cao Y, et al. Swin Transformer: Hierarchical Vision Transformer using Shifted Windows[C]. ICCV, 2021.
[3] 原论文全文链接:https://arxiv.org/pdf/2608.09391v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完了插值和分割互相成就的漂亮戏法,是不是也想在专业圈子里找同好?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。