← 返回 PaperDaily 视觉与图像

北航×清华医学图像恢复:一个模型统一10类2D/3D任务

论文方法: 统一恢复框架(All-in-One)中的层级同质性与异质性建模框架(UniH3) 原文标题: UniH³: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration 首次公开: 2026年9月10日(arXiv v1)

论文方法:统一恢复框架(All-in-One)中的层级同质性与异质性建模框架(UniH3)

原文标题:UniH³: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration

首次公开:2026年9月10日(arXiv v1)

主要署名单位:北京航空航天大学、清华大学

研究领域:医学图像恢复、统一模型、多模态影像增强

原论文:https://arxiv.org/abs/2609.11156

龙哥导读

医院里的多种医学影像绝不只是几种普通文件格式或普通医学数据,它们背后是不同成像物理、不同噪声和不同空间分辨率。过去常见做法是一个任务养一个模型;UniH³反过来问:既然不同模态都在观察人体结构,能不能让一个模型共享解剖知识,同时又别让扫描仪、中心和患者差异互相拖后腿?论文用7类二维任务、3类三维任务回答了这个问题。

如果一家医学影像平台同时接入正电子发射断层成像技术(PET)、计算机断层成像技术(CT)、磁共振成像技术(MRI)、X光、光学相干断层、超声和病理图像,最直观的工程方案,是每种模态、每种退化各训练一套网络。这样做容易理解,却会迅速积累模型版本、部署环境、显存预算、测试标准和维护责任。新设备接入时,还可能再复制一套训练流程。
统一医学图像恢复想解决的,就是这种“模型越做越多,系统反而越来越难管”的问题。它希望用一个模型处理多种模态和退化:低剂量PET与CT需要去噪,MRI和病理图像可能需要超分辨率,超声、X光与光学相干断层也各有噪声特征。一个入口、一个骨干、多个任务,听起来很省事,训练时却会立刻遇到矛盾。
矛盾的第一面是差异。PET的计数噪声、CT的低剂量伪影、MRI的欠采样与分辨率限制,并不是同一类退化;即使都叫CT,不同扫描仪、不同中心、不同患者与解剖部位也会改变数据分布。把它们粗暴混在一起,某些数据量大、梯度强的任务可能主导训练,其他任务只能“陪跑”。
矛盾的另一面恰好相反:这些图像并非毫无关系。无论成像机制怎样变化,脊柱、颅脑、胸腔、器官轮廓与病灶周围结构仍然存在可共享的解剖规律。只强调任务差异,会浪费医学图像最宝贵的共同先验;只强调共同结构,又会掩盖真实的设备和患者差异。
UniH³的核心价值,就在于同时处理这两面。名字里的三个H分别指向层级化的同质性与异质性:模型既要找到任务内部和任务之间可以共享的结构,也要在任务级与样本级识别冲突。它不是简单给网络再塞一个提示向量,而是把“共享什么、怎样使用、冲突怎样平衡”拆成三个相互配合的组件。

图1|论文 Figure 1。左侧是四层U形恢复骨干;中间的层级同质性记忆从高质量图像蒸馏共享与任务专属先验,并在多尺度位置指导恢复;右侧的层级异质性平衡器按任务和样本调整训练权重。来源:论文官方全文。

一、先分清“同质性”:不同影像为什么还能共享知识

论文说的同质性,不是把PET、CT、MRI当成相同数据,也不是假设所有患者长得一样。它指的是可重复出现的结构规律。任务内部,同一种模态的不同患者会共享相似的器官与骨骼组织关系;任务之间,不同模态虽然灰度和对比度不同,仍可能描述同一套人体解剖结构。
可以把它想成多位摄影师用不同相机拍同一栋建筑。红外、可见光和深度图的像素分布不同,但门窗、楼层与承重结构不会凭空消失。医学图像更复杂,也更谨慎,但“成像外观不同、结构关系可共享”这条直觉成立。关键是模型不能只背一张平均模板,而要针对当前输入取回相关的结构知识。
为此,UniH³设计了层级同质性记忆,简称H²M。记忆由任务共享槽和任务专属槽组成:共享槽保存跨模态都可能有用的结构,专属槽保存某个恢复任务内部更稳定的规律。若有T个任务,记忆里就有T组专属槽,再加一组共享槽,每组由若干可检索的记忆单元构成。
训练时,模型同时看到低质量图像和对应的高质量图像。可学习原型先根据低质量特征提出“当前最需要什么结构”的查询,再从高质量特征里聚合与之相关的信息。这里不是把整张高质量图直接塞进网络,而是把可反复复用的紧凑结构表示提炼出来。
提炼后的信息通过指数移动平均写入记忆。更新形式可以白话理解为:旧记忆保留大部分,新批次贡献一小部分,随着训练逐渐形成稳定原型。共享槽吸收跨任务共同结构,专属槽吸收当前任务的内部规律。这样能避免记忆只跟着某一个批次剧烈摆动。
这个蒸馏过程只发生在训练阶段。推理时不需要高质量真值,也不需要再更新记忆;模型用当前低质量输入去查询已经学好的原型与记忆,取回最相关的高质量结构先验。它不是测试时偷看答案,而是把训练集中反复出现的清晰结构压缩成可检索知识。
论文在U形骨干的四个尺度都放入H²M。浅层分辨率高,更适合保留边缘、纹理和小结构;深层分辨率低,覆盖范围更大,更适合描述器官布局与整体关系。多尺度记忆让“共享知识”不只停留在一个抽象向量,而能在不同空间粒度参与恢复。

二、同质性引导注意力:别让噪声继续当主角

有了记忆,还要解决怎样把它注入恢复网络。常见做法是空间特征变换或交叉注意力:低质量特征是主体,外部先验只是补充。UniH³认为这不够积极,因为低质量观测本身可能缺失细节、带有强噪声;如果始终以它为中心,网络仍要从一个不可靠起点艰难纠错。
论文提出同质性引导注意力(HGA)。普通注意力可以写成“注意力矩阵A乘以值V”。这里的V来自低质量图像。最简单的引导方式,是把检索到的高质量先验Vᴴ加到V上,让注意力同时传播观测信息和结构先验。
但简单相加默认两者同等可靠。论文进一步引入一加一减:对高质量先验增加自身贡献,对低质量值减少相同方向的贡献。直觉上,模型不是把噪声和清晰先验各投一票,而是在需要时让先验拥有更高权重,同时保留观测中确实存在的个体信息。
最终公式可概括为两部分。第一部分用可学习系数λ₁在低质量值与高质量先验之间混合,再通过注意力矩阵传播;第二部分用λ₂乘以“先验减观测”的差异,直接提供纠偏方向。当λ₁和λ₂都为零时,它退化成普通注意力,因此网络可以按通道学习何时依赖记忆、何时坚持当前观测。
这里有一个很重要的医学影像常识:先验不能压过真实个体差异。记忆里常见的结构不应把罕见病灶“修没了”。HGA保留低质量输入通路,并用可学习权重调节,而不是拿固定模板覆盖图像;但它是否对少见病、术后结构和极端异常足够稳健,仍需要专门临床数据验证。
论文实际采用基于转置自注意力的版本,延续Restormer一类恢复骨干的通道建模方式。每个同质性引导Transformer块还配有局部卷积与通道重标定:一层关注更广的关联,另一层补局部纹理。恢复结果通过残差连接写成“低质量输入加预测残差”,避免网络从零重画整幅图像。

三、层级异质性平衡:任务不同,样本也不同

统一模型的第二个难点发生在优化阶段。假设七个二维任务一起训练,每个任务产生一组梯度。若某个任务损失大、样本多或梯度强,它可能持续拉着参数向自己的方向走。其他任务即使更难,也可能因为梯度被淹没而学得不足。
传统不确定性加权会为每个任务学习一个标量σ。任务损失越容易主导,总权重就会被适当压低;较难或被忽视的任务可以获得更多关注。这解决了任务之间的粗粒度不平衡,却把同一任务里的所有样本视为同等难度。
现实并非如此。同样是CT去噪,设备型号、剂量、重建核、中心协议、解剖部位和患者状态都会改变难度。只给“CT任务”一个固定权重,就像给整个班级设一个平均辅导时间:班级之间看似公平,班内最需要帮助的学生仍然可能被忽略。
H²B把总不确定性拆成“任务项σₜ加样本修正Δσₛ”。任务项处理PET、CT、MRI等任务之间的差异;样本修正由轻量估计模块根据低质量输入、当前恢复结果和高质量真值预测。恢复结果在这条支路上停止梯度,避免权重估计反过来用投机方式操纵主网络。
训练损失随后按每个任务、每个样本的不确定性缩放。难样本不再被一个任务平均值掩盖,简单样本也不会无限占用优化容量。这使“异质性”从任务标签下沉到具体病例,正是UniH³比许多统一恢复方法更细的一步。
需要注意,H²B只在训练中需要高质量真值来估计样本难度。推理阶段不再运行这套损失平衡器,因此不会给医院部署增加同等规模的在线开销。它更像一位训练调度员:决定每批数据该怎样教,而不是在每次检查时都插手输出。

四、十类任务与两套基准,实验规模到底有多大

论文整理了两套大规模基准。二维基准包含509,200对低质量—高质量图像,覆盖7类任务:PET去噪、CT去噪、MRI超分、X光去噪、光学相干断层去噪、超声去噪和病理图像超分。训练集458,000对,测试集51,200对。
三维基准包含3,522个体数据,覆盖PET去噪、CT去噪和MRI超分三类任务,其中3,166个用于训练,356个用于测试,规模与任务构成都有明确且可复查的统计。二维和三维并不是把同一张切片重复计数:三维模型需要处理体素邻域和切片间连续结构,计算与显存压力都更高。
从模态分布看,二维数据并不均衡:X光约119,600对,PET约85,600对,MRI约83,400对,CT约72,100对,超声约61,800对,病理约51,100对,光学相干断层约35,600对。这种不均衡正好给H²B提供了现实测试,而不是人为构造每类完全相同的数据量。
数据来源同时包含公开数据与私有PET、CT数据。它扩大了实验覆盖,却也带来复现限制:公开方法、训练配置和代码并不等于所有训练数据都能立即获得。对于想复现实验的团队,首先应区分“代码可见”“公开数据可下载”和“论文完整基准可重建”这三件事。
评价使用峰值信噪比和结构相似性。峰值信噪比更关注像素误差,结构相似性更关注局部结构、亮度与对比度关系。两者能衡量恢复图像与高质量参考之间的接近程度,但它们不是临床诊断准确率,也不能独立说明病灶是否被正确保留。

图2|论文 Figure 4。图中按PET、CT、MRI、X光、光学相干断层、超声和病理任务对比多种统一恢复方法;放大区域用于观察结构边缘、细纹理和噪声残留。来源:论文官方全文。

五、结果怎么看:领先不大,但覆盖面很宽

在二维统一设置中,一个UniH³模型同时处理7类任务。论文将它与六种通用图像恢复方法和六种统一恢复方法进行系统对比,覆盖卷积、Transformer、状态空间与任务自适应等不同路线,其中表现最接近的是自适应统一恢复方法(AdaIR)。这样的对照范围能同时检验统一训练本身和具体结构设计是否真正带来增益。
平均结果上,UniH³达到36.77 dB峰值信噪比和0.9045结构相似性,平均峰值信噪比比第二名AdaIR高0.21 dB。0.21 dB不是视觉上翻天覆地的差距,但它发生在7类任务、51,200张测试图像的统一平均上,说明收益并非只来自某一个小任务。
二维模型参数量约2896万,计算量约263.3亿次操作。它并不是表中参数最少的方案,也不是靠无限扩大骨干换指标;相对同一基线,H²M增加约179万参数和不到10亿次操作。对医学部署而言,这仍需结合图像尺寸、批量、设备和时延测量,不能只凭理论计算量判断实时性。
在三维统一设置中,UniH³的三维版本同时处理三类任务,平均峰值信噪比达到43.81 dB,比次优方法高0.55 dB。三维数据量更小,但任务本身更重;0.55 dB的平均差距说明层级共享与平衡思路并不只适用于二维切片,也能延伸到完整三维空间的体数据等场景。
单任务实验同样重要,因为它回答“统一模型是不是靠任务互相迁就”。二维单任务平均峰值信噪比比第二名状态空间恢复方法(MambaIR)高0.15 dB;三维单任务平均比次优方法高1.48 dB。作者还观察到,先训练统一模型再针对单任务微调,可以把共享知识迁移到专用模型。
这给工程团队提供了两条路线。资源有限时,直接部署统一模型减少维护数量;关键任务对指标更敏感时,可以把统一模型当作预训练骨干,再做专用微调。“统一”不必意味着永远只保留一套权重,它也可以成为更好的公共起点。

六、消融实验:三个组件不是装饰件

组件消融从基础模型的36.52 dB开始。只加入H²M后升到36.66 dB,只加入H²B后升到36.64 dB,两者一起达到36.77 dB。两条路径分别贡献增益,组合后最好,符合“共享结构降低学习难度、样本平衡减少训练冲突”的设计逻辑。
HGA也做了替换对照。没有引导时是36.52 dB,空间特征变换达到36.74 dB,交叉注意力达到36.67 dB,HGA达到36.77 dB。更关键的是,HGA参数和计算增量低于空间特征变换,说明收益不只是因为模块更大。
同质性记忆内部也被拆开。只用跨任务共享先验得到36.61 dB,只用任务内部先验得到36.72 dB,两者同时使用达到36.77 dB。任务内部收益更大,说明同一模态与退化中的稳定结构尤其重要;共享槽仍提供额外帮助。
异质性平衡的结果相似。只做任务间平衡达到36.70 dB,只做任务内部样本平衡达到36.73 dB,两者一起达到36.77 dB。样本级变化并不是可以忽略的噪声,它对最终平均结果的贡献至少与任务级平衡相当。
论文还把H²M和H²B接到四种具有代表性的Transformer与统一恢复骨干上,各自平均结果都有提升。这一点能降低“只对作者自家网络有效”的担忧。它不能证明模块对所有架构都通用,但说明设计与某一个特定骨干并非完全绑定。

图3|论文 Figure 6 的记忆检索注意力面板。红框标出得分最高的记忆单元;相似PET脊柱位置的Top-10检索高度重合,PET与CT脊柱存在部分跨模态重合,而脊柱与病灶区域的重合接近零。来源:论文官方全文。

记忆检索图给出了比总指标更直观的解释。两个PET脊柱位置的前十个高分记忆单元有8个重合;PET与CT脊柱有2个重合;PET脊柱与病灶位置没有重合。它说明记忆不是只按任务标签机械选槽,还能对解剖语义做一定区分。
不过,注意力图仍是模型内部行为证据,不等价于医学因果解释。它能支持“检索与结构相似性相关”,却不能直接证明每个记忆单元代表某个可命名器官。要把它用于临床可信解释,还需要更系统的跨中心、跨疾病和干预实验。

七、与两条统一恢复路线相比,它补上了哪一环

任务自适应路由方法(AMIR)是统一医学图像恢复的重要前序工作,它通过路由缓解不同恢复任务的冲突。它的核心问题是“一个模型如何为不同任务选择不同专家路径”。UniH³并没有否定路由,而是把视角扩展到任务之间可共享的解剖结构,以及同一任务内部的样本差异。
AdaIR来自统一自然图像恢复路线,强调从频率中挖掘退化特征并进行自适应调制。它适合解释雨、雾、噪声、模糊等自然图像退化之间的差别。UniH³面对医学图像时,把重点从退化频率进一步推进到多模态共享结构、任务专属记忆与样本级优化。
三者可以看成统一恢复研究的三种互补问题:路由回答“该走哪条处理路径”,频率调制回答“当前退化需要怎样的特征调整”,层级同质—异质建模回答“哪些结构值得共享、哪些差异必须被尊重”。未来更强的统一模型,很可能会组合这些思想,而不是只押注其中一个。

八、离真实医院部署还有几道门

第一道门是数据。论文基准规模很大,但混合了公开数据和三套私有PET、CT来源。不同医院的数据协议、重建软件、设备厂商和人群组成可能继续产生分布偏移。外部团队需要用自己的中心数据验证,而不能把论文平均分直接当作上线指标。
第二道门是临床任务。峰值信噪比提高,通常意味着像素更接近参考图;医生真正关心的是病灶边缘、微小钙化、低对比度区域和定量参数是否可靠。恢复模型尤其要警惕“看起来更干净,但删掉异常”或“补出并不存在的结构”。
第三道门是覆盖范围。论文每种模态只选择了一个主要恢复任务,例如MRI主要研究超分,而没有把同一模态可能遇到的去噪、伪影抑制、欠采样重建等全部纳入。所谓10类任务,是当前基准中的7类二维加3类三维,不等于覆盖所有医学图像退化。
第四道门是三维成本。体数据对显存和计算的要求显著高于二维切片,医院工作流还涉及标准医学影像格式、序列一致性、后处理和阅片系统接口。论文提供算法结果,但端到端吞吐、延迟、硬件兼容和质量控制仍需单独评估。
第五道门是治理。一个统一模型服务更多模态后,版本升级影响范围也更大。单任务模型的问题可能局限在一条流程,统一模型的回归错误可能同时影响多条检查链。因此部署收益越大,测试矩阵、灰度发布、审计记录与回滚机制越不能省。
还有一个容易被平均指标遮住的问题:统一模型的失败不能只看总体均值。医院更需要按模态、设备、部位、病种和人群分层报告,尤其关注最差分组、极端噪声和少见异常。某个大任务多提升一点,不能抵消小样本关键场景明显退步。
因此,真正有说服力的下一步应包括跨中心外部测试、盲法阅片、下游分割或检测评估,以及对异常结构保持率的专门分析。只有像素指标、医生判断和临床任务同时改善,统一恢复模型的工程优势才能真正转化成可信且可持续的医学价值。

龙哥点评

龙哥认为,这篇论文最值得看的不是“又涨了0.21 dB”,而是它把统一医学恢复里的两种相反力量摆到了同一张桌上。人体结构确实可以共享,设备、中心、患者与任务差异也确实不能抹平。把二者都建模,比一味强调通用或一味强调专用更接近真实系统。
H²M的设计像给模型建立一座分层医学影像资料室:公共书架放跨模态结构,专属书架放任务内部规律;输入进来后,不是把整座图书馆搬进网络,而是检索当前最相关的几页。HGA再决定这些清晰经验该怎样纠正受损观测。
H²B则提醒我们,数据标签并不能完整描述难度。同一个任务里,设备和病例差异可能比两个平均任务之间还大。把权重从任务级下沉到样本级,是很朴素也很实用的工程思想:不要只看部门平均值,要看真正卡住训练的具体样本。
我也会克制看待“通用模型”这个词。当前证据说明一个模型可以覆盖论文定义的10类二维/三维任务,并在对应数据上取得强结果;它还不是一套拿到任何医院、任何设备、任何退化都能直接工作的万能修复器。
这条路线真正的长期价值,是把“每个任务从头训练”改造成“共享结构知识、按样本尊重差异、必要时再专门微调”。如果后续数据开放、跨中心验证和临床任务评估能跟上,它会比单纯追逐一个平均指标更有生命力。

龙迷三问

第一问:统一模型会不会把不同模态修成同一种样子?不会因为“统一”就必然同质化。UniH³保留任务专属记忆和当前输入通路,并通过层级平衡尊重差异;但罕见结构是否会被常见先验压制,仍需跨疾病数据专项验证。
第二问:0.21 dB是否值得关注?单看数值不算巨大,但它来自7类任务的大规模统一测试,并伴随三维、单任务、跨骨干和消融证据。是否值得部署,则要换算成医院自己的图像质量、诊断任务、时延和维护成本。
第三问:这项工作最适合谁跟进?适合维护多模态影像平台、研究医学基础模型或拥有跨中心恢复数据的团队。最有价值的复现不是重复平均分,而是测试跨设备泛化、异常结构保持和统一模型的运维收益。

主要参考资料

UniH³论文:

https://arxiv.org/abs/2609.11156

AMIR:

https://arxiv.org/abs/2405.19769

AdaIR:

https://arxiv.org/abs/2403.14614

本文基于龙哥读论文数据库及论文挖掘工具进行汇总整理。

本文为论文解读,实验数字来自论文公开稿;图像质量指标不等同于临床诊断收益,具体应用需结合跨中心验证与医学评估。

end

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球