← 返回 PaperDaily
视觉与图像
哈工大深圳新框架:医学分割从三套系统变一套
医学分割最难的不是“切得准”,而是“接口太多”。这篇论文把视觉示例、点框交互、文本指令和2D/3D影像统一到一个Transformer序列里,思路很硬,工程味也很足。
龙哥读论文
阅读 4
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
医学分割最难的不是“切得准”,而是“接口太多”。这篇论文把视觉示例、点框交互、文本指令和2D/3D影像统一到一个Transformer序列里,思路很硬,工程味也很足。
原论文信息如下:
医学分割的“三座孤岛”如何统一?
医学图像分割看起来像一件事,实际上常常被拆成三套系统:视觉示例式的 in-context learning、点框等交互式分割、文本引导分割。再加上 2D 和 3D 影像通常还要分开做,最后的结果就是:数据很多,接口很多,模型也很多,但彼此之间几乎不说话。
这篇 UniMedSeg 的切入点很直接:既然医学分割真正难的不是“有没有监督”,而是“监督长什么样”,那就别把不同监督格式硬拆成不同模型。论文干脆把视觉示例、几何交互、语言指令、2D/3D 影像一起塞进同一个序列空间里,让它们通过统一的 in-context 接口学习。说人话就是:把医学分割从“多套门禁卡”改成“一张通行证”。
这一步的价值不只是“统一”,而是统一之后还能继续扩展。以前很多医学分割模型一遇到新提示格式,就得单独加分支、单独训练、单独适配;UniMedSeg 的思路更像通用语言模型:输入可以不同,但底层表示尽量统一。这样一来,异构标注不再是碎片化资产,而是能一起喂给同一个大模型的训练材料。
告别U-Net:Transformer如何定义新范式?
传统 U-Net 的强项是局部归纳偏置很稳,做单任务分割非常能打;但它的问题也很明显:输入通道和结构是写死的,遇到文本、点、框、mask 这类不同形态的提示时,天然就不够灵活。UniMedSeg 选择直接换赛道,改用 Transformer-centric 的架构,把“图像”和“提示”都当成 token,而不是当成两类完全不同的东西。
这里的关键不是简单地“把图像拉平”,而是拉平之后还要让模型知道谁是谁、谁和谁对应。论文用了两个小设计来补这个课:一个是 Type Embedding,中文可以理解为“类型嵌入”,用来告诉模型当前 token 是上下文图像、上下文标签/提示,还是目标图像;另一个是 RoPE,即 Rotary Position Embedding,旋转位置编码,用来保留 2D 或 3D 空间位置关系。前者解决“身份识别”,后者解决“空间定位”。
这套设计的本质很朴素:如果模型连“哪个 token 来自哪张图、哪种提示”都分不清,后面再强的注意力也容易把关系学歪。UniMedSeg 先把身份和位置钉住,再让 Transformer 去做深层交互,属于先立规矩再谈自由发挥。
而且它没有把 2D 和 3D 当成两套完全独立的工程。2D 输入和 3D 输入都先经过各自维度的 patch embedding,再共享同一个 Transformer 主干,最后再用轻量的维度特定解码器恢复空间结构。这样做的好处是,模型能在同一表示空间里吸收 2D 切片和 3D 体数据的知识,避免“二维模型只会看平面、三维模型只会看体积”的老毛病。
线性复杂度注意力:如何“解耦”长序列?
真正卡住这类统一模型的,不是“想法不够大”,而是“序列太长”。医学图像一旦上到 3D,再叠加多个视觉示例、mask 或文本,token 数量会膨胀得很快。标准全局注意力是二次复杂度,序列一长,显存和算力就开始闹脾气。UniMedSeg 的处理方式很有工程味:Decoupled Split Attention,中文可以理解为“解耦式分裂注意力”。
这个名字听着像学术黑话,实际逻辑并不玄。论文观察到,在视觉示例学习里,不同上下文对之间并不一定需要彼此“串门”,更重要的是它们和目标图像之间的对应关系。于是它把注意力分成两条路:一条是目标路径,负责从所有上下文里吸收信息;另一条是上下文路径,每个上下文对只和目标以及自己内部交互,不再让所有上下文彼此混战。
这样做的收益有两个。第一,模型不必靠自己从数据里慢慢学“哪张图对应哪张 mask”,因为结构上已经把配对关系固定住了;第二,更重要的是,计算量从对总长度 O(L²) 的全局注意力,变成了更接近 O(L) 的分解式计算。对于 3D 长序列来说,这不是“优化一点点”,而是能不能跑起来的差别。
论文还特意把这个机制做成了更适合硬件的 dense computation 形式,方便直接吃现成的高效注意力内核,比如 Flash Attention。说白了就是:不只要算法上省,工程上也别太折腾。这个点很实在,因为很多论文的“高效”只停留在公式层面,真落地时还得再写一轮祖传 CUDA 适配,最后把自己绕晕。
三管齐下:ICL、交互与语言全都要
UniMedSeg 最有意思的地方,不是它支持某一种任务,而是它真的想把三种主流分割范式揉成一锅。论文把训练时的输入模式分成四类:只用视觉示例、只用交互提示、只用语言指令,以及两种或三种范式混合。这样训练的目的很明确:让模型不是“会做一道题”,而是“会切换答题方式”。
在视觉 in-context learning 场景里,模型拿到的是支持图像和对应 mask,靠示例来推断目标图像的分割方式;在交互式分割里,输入可以是点、框、涂鸦、套索,甚至是 dense slice 这种更重的提示;在语言引导里,文本不再只是“辅助条件”,而是直接告诉模型要找什么结构,比如某个脑区或器官。UniMedSeg 的统一接口让这些输入都能在同一个序列空间里协同工作。
这件事的现实意义很大。医学数据最不整齐的地方,就是标注方式五花八门:有的医院喜欢画框,有的标点,有的只有文本报告,有的有 2D 切片,有的直接是 3D 体数据。以前这些数据往往只能分开训练,最后谁也吃不饱。UniMedSeg 的思路相当于把“碎片化标注”变成“统一语料”,这才像基础模型该干的事。
实验结果:全面的性能碾压
这篇论文的实验设计比较完整,核心不是只挑一个任务刷分,而是把三种范式、两种维度、多个未见任务一起拉出来比。训练数据来自 27 个公开数据集,外加 2 万个合成 3D 体数据;测试则刻意放在未见中心、未见器官、未见物种上,目的是看模型到底是“背题”还是“真会泛化”。这种设置比单纯在同域数据上比高低要靠谱得多。
先看 3D ICL 的结果。UniMedSeg 在 16 个未见任务上整体表现最好,S 版和 L 版都超过了大多数基线,尤其是在未见中心、未见器官和未见物种场景里,优势比较稳定。更关键的是,它还是 无需任务特定微调 的,这意味着模型不是靠最后临门一脚的微调补分,而是靠统一表征本身就学到了跨任务迁移能力。
再看 2D ICL。这里的 context size 设得更大,竞争也更充分。UniMedSeg 依然保持领先或接近领先,说明它并不是只在某个特定上下文长度下“碰巧好用”。更重要的是,2D 和 3D 的统一并没有把模型拖垮,反而让它能在不同空间维度下共享知识。这个结果很像在说:二维和三维不是两门互不相干的课,它们至少能共用一本教材。
交互式分割部分也比较有说服力。论文在点和框两种提示下做了 12 个未见任务的比较,UniMedSeg 在多数任务上都能稳定优于或接近强基线。这里的亮点不只是分数高,而是它对不同交互形式的适应性更强。点提示更稀疏,框提示更粗糙,模型仍然能把空间先验和目标边界对齐,说明统一 token 空间确实让几何提示更容易和图像内容融合。
语言引导任务则更能体现这套框架的上限。文本在医学分割里最怕两件事:一是语义太抽象,二是和图像空间对不上。UniMedSeg 通过 BioMedBERT 先把文本转成语义 token,再和目标图像一起进统一序列,避免了把文本当“外挂条件”的弱绑定方式。实验里,文本+ICL 的组合通常优于单独文本或单独 ICL,说明不同范式之间不是互相打架,而是能互补。
消融实验也比较诚实。去掉关键模块后,性能会掉;换掉注意力机制或位置编码后,也会掉;把上下文处理方式改回更朴素的全局注意力,效率会明显变差。尤其是效率消融里,随着上下文数 k 增大,解耦式注意力的优势越来越明显,这和前面的复杂度分析是对得上的,不是“玄学涨点”。
未来展望:通往真正的通用医学基础模型
UniMedSeg 的方向很明确:它不是只想在某个 benchmark 上刷一个漂亮数字,而是想把医学分割里最常见的几种监督形态统一起来,做成一个能持续扩展的底座。这个思路是对的,因为未来医院里真正有价值的,不是“某个任务的专用模型”,而是一个能吃下不同标注、不同维度、不同输入接口的通用系统。
但它也不是没有边界。第一,语言引导目前主要集中在脑部结构,离真正全院级、多器官、多模态的语义覆盖还差一步。第二,尽管解耦式注意力让长序列更可控,但当上下文类型继续膨胀、模态继续增多时,统一空间里的对齐难度还是会升高。第三,医学场景对稳定性要求极高,单次 demo 好看不等于临床可用,跨设备、跨中心、跨协议的鲁棒性还需要更长时间验证。
不过从工程角度看,这篇工作已经把“统一医学分割”从概念拉到了可运行的系统层面。项目还提供了一键推理脚本、公开权重和针对脑部、肝脏的测试入口,这意味着它不是只停在论文页上的漂亮概念,而是已经有了基本可复现、可试用的骨架。对做医学 AI 的团队来说,这种工作最现实的价值,就是少走很多“每种提示都重写一遍模型”的弯路。
龙迷三问
这篇论文到底解决了什么问题?它解决的是医学分割里“任务接口太碎”的问题。以前视觉示例、交互提示、文本引导、2D/3D 影像各做各的,UniMedSeg 试图把它们统一到一个 Transformer 序列接口里,让不同监督信号能一起训练、一起泛化。
Decoupled Split Attention 是什么?可以把它理解成“把长序列注意力拆开算”。目标图像仍然看全局上下文,但每个上下文对不再彼此乱串,而是只和目标以及自己配对的信息交互,从而把二次复杂度压到更接近线性。
为什么它看起来更像基础模型,而不是普通分割网络?因为它不是为单一数据集或单一提示格式定制的,而是把多种监督形式统一成序列 token 后共同学习。再加上公开权重、统一推理脚本和多任务评估,它已经具备“通用底座”的雏形。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 这篇工作真正新的是“统一接口”加“解耦注意力”的组合,不是单点修修补补,而是把医学分割的碎片化问题正面收编了。
实验合理度:★★★★☆ 训练和测试都覆盖了未见中心、未见器官、未见物种,比较像在考泛化能力,不是只在熟题上刷分。
学术研究价值:★★★★★ 对医学基础模型方向很有价值,尤其是把多范式监督统一到同一序列空间这件事,后续很容易继续扩展。
稳定性:★★★☆☆ 结构上更统一,但临床级稳定性还要看更大规模、多中心、跨协议验证,当前更像强研究原型。
适应性以及泛化能力:★★★★☆ 对 ICL、交互、文本三类任务都有覆盖,跨任务迁移能力不错,但语言引导范围目前还不算特别广。
硬件需求及成本:★★★☆☆ 解耦注意力确实省了长序列开销,但 3D 医学模型本身还是吃算力,离“随便一台机器都能跑”还有距离。
复现难度:★★★★☆ 代码和权重公开是加分项,目录也比较清晰;真正难点主要在数据准备和多任务评估流程。
产品化成熟度:★★★☆☆ 适合做研究平台或辅助分割原型,离临床闭环产品还需要更严格的鲁棒性和合规验证。
可能的问题:统一得很漂亮,但任务越多、模态越杂,统一表示的对齐压力也会越来越大,后续是否还能稳住是关键。
主要参考文献
[1] UniMedSeg: Unified In-Context Learning for Multi-Paradigm 2D/3D Medical Image Segmentation. arXiv:2607.12896v1.
[2] 项目代码:https://github.com/Lii1228/UniMedSeg
[3] 论文原文:https://arxiv.org/pdf/2607.12896v1.pdf

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群

