← 返回 PaperDaily 视觉与图像

上海交大等提出VDeAR:LDCT去噪首次用上视觉自回归,细节更稳

低剂量CT去噪最怕两件事:一是把噪声抹掉,二是把病灶也顺手抹掉。VDeAR偏偏换了个思路,用视觉自回归做下一尺度预测,再拿残差细化器补高频细节,思路挺新,结果也挺能打。

上海交大等提出VDeAR:LDCT去噪首次用上视觉自回归,细节更稳
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
低剂量CT去噪最怕两件事:一是把噪声抹掉,二是把病灶也顺手抹掉。VDeAR偏偏换了个思路,用视觉自回归做下一尺度预测,再拿残差细化器补高频细节,思路挺新,结果也挺能打。


原论文信息如下:
论文标题:
低剂量CT去噪中的视觉自回归建模
发表日期:
2026年06月
发表单位:
上海交通大学,SenseTime Research,上海人工智能实验室
原文链接:
https://arxiv.org/pdf/2606.29198v1.pdf

LDCT去噪的新范式:视觉自回归模型如何突破瓶颈?

低剂量CT去噪这件事,表面上是“把噪声去掉”,实际上更像在和医生抢细节:噪声没了,病灶也别跟着没了。传统卷积网络常常把图像抹得太平,GAN又容易为了“好看”乱编细节,Transformer能看全局,但怎么把粗糙结果一层层修到临床可用,仍然是个老大难。
这篇论文直接换了一个路子:把视觉自回归模型搬到低剂量CT去噪里,用“下一尺度预测”代替一次性生成。说人话就是,不再一口气猜完整张图,而是先把结构骨架搭出来,再逐层补细节,像修图时先打底再精修,而不是上来就狂按美颜滤镜。
图1:ARVDe整体框架示意图
图1:ARVDe整体框架示意图。输入低剂量CT后,先经过层级式编码器提取前缀token,再由视觉自回归Transformer按尺度逐步预测目标正常剂量CT的离散潜变量,最后结合残差细化器与混合解码器还原高保真图像。
这套方法的名字是ARVDe,全称是Visual Autoregressive Modeling for Low-Dose CT Denoising,中文可以理解为“用于低剂量CT去噪的视觉自回归建模”。其中,AR是Autoregressive,中文叫“自回归”;NDCT是Normal-Dose CT,中文叫“正常剂量CT”;LDCT是Low-Dose CT,中文叫“低剂量CT”。这些缩写不复杂,但很关键,因为整篇论文的逻辑就是:用LDCT作为条件,去生成更接近NDCT的结果。

从全局到局部:下一尺度预测的核心原理

这篇工作的核心,不是简单把“生成模型”四个字贴到CT上,而是认真回答了一个问题:临床图像到底该怎么生成,才既像真图,又不乱补细节?答案是:先让模型看到全局,再让它一点点往局部细节走。
图2:自回归Transformer与残差细化器示意图。左侧展示了双潜在训练策略,右侧展示了带残差细化器的自回归Transformer。前者负责让离散潜变量和连续潜变量“说同一种语言”,后者负责把量化丢掉的高频细节补回来。
先看整体流程。输入一张低剂量CT,编码器会把它压成一串“前缀token”。这里的token不是聊天机器人那种词元,而是图像被切块、离散化后得到的表示。模型把这些前缀token当作条件信息,像拿着地图和起点坐标一样,去预测正常剂量CT的离散token地图。这里用的是下一尺度预测,英文叫next-scale prediction,意思不是逐像素“补字”,而是先预测低分辨率结构,再逐步扩展到更细尺度。
这一步为什么重要?因为CT图像不是普通照片。普通照片里多一点纹理,少一点纹理,可能只是“看着不够高级”;但CT里多一点假结构,少一点小血管、小结节,代价就是诊断风险。下一尺度预测的好处在于,它先保证全局结构稳定,再逐层恢复局部细节,比“从噪声里一把梭”更符合医学图像的生成规律。
论文里还有一个很关键的设计:LDCT前缀token始终可见。这相当于给模型一个稳定的条件锚点,避免它在多尺度生成中“越走越偏”。如果没有这个锚点,模型很容易在细节层面开始自由发挥,最后就会出现医学图像最怕的那种情况:看起来挺清楚,实际上不一定对。
从实现上看,Transformer负责建模离散token之间的依赖关系,尤其擅长捕捉长程结构一致性。对于CT这种“整体轮廓不能乱、局部纹理也不能丢”的任务,这种全局建模能力比纯卷积更自然。论文的做法不是把Transformer当万能药,而是让它负责最擅长的部分:先把结构关系理顺,再把最难啃的高频信息交给后面的细化模块。

残差细化器与双潜在训练:如何挽救丢失的高频细节?

视觉自回归模型有个天然短板:离散化会丢信息。这不是模型不努力,而是量化这一步本身就像把彩色照片压成低码率图片,边缘、纹理、细小结构多少会被损掉。对自然图像来说,这个损失可能还能靠“看着差不多”糊过去;但对CT图像来说,糊过去可不行。
所以论文额外加了一个残差细化器。它的作用很直白:不去重新生成整张图,只去补“离散表示和连续表示之间的差额”。这个差额可以理解为量化后没能保住的那部分高频信息,比如细血管边缘、微弱组织纹理、局部锐利轮廓。模型先生成一个基础版本,再用残差细化器做精修,思路上比“从头到尾都靠离散token硬扛”靠谱得多。
这里还有一个更工程化的设计,叫双潜在训练,英文是Dual-Latent Hybrid Training, DLHT。所谓“双潜在”,就是同时处理离散潜变量和连续潜变量。离散潜变量更适合自回归建模,连续潜变量更适合保留细腻纹理。难点在于,这两种表示天生不是一回事,训练时如果各干各的,推理时就容易“语言不通”。DLHT的作用,就是强行把这两种表示对齐,让混合解码器在推理时能同时吃到两边的好处。
图3:定性对比结果示意图
图3:定性对比结果示意图。可以看到,部分卷积方法容易过度平滑,部分对抗式方法又可能引入伪影;ARVDe在结构连续性和细节保真之间更均衡,尤其对血管、器官边缘等细节更友好。
如果把整个方法拆成一句大白话,那就是:Transformer负责“先想对”,残差细化器负责“再修细”,双潜在训练负责“让两种修法不打架”。这三件事缺一都不太行。只靠Transformer,容易细节不够;只靠细化器,容易全局不稳;只靠离散表示,容易丢高频。论文的聪明之处,在于没有迷信单一路线,而是把生成、修复、对齐三件事拆开做。
从论文的训练思路看,模型不是简单端到端喂数据,而是先让混合解码器学会在离散和连续空间之间切换,再让残差细化器补上量化损失。这个顺序很重要。很多方法的问题不是模块不强,而是训练顺序不对,结果就是模块各自很能打,拼起来却像临时拼桌,谁也不服谁。

实验表现:全面领先的定量与定性结果

实验部分没有玩虚的,直接上了两个公开数据集:Ma-2016Ma-2020。前者来自低剂量CT挑战赛,后者来自低剂量CT图像与投影数据集。数据都是配对的低剂量/正常剂量CT,适合检验去噪是否真的把图像往正确方向拉,而不是往“看起来顺眼”的方向乱拽。
表1:参考指标对比结果
表1:参考指标对比结果。ARVDe在两个数据集上都拿到了更强的峰值信噪比和更低的均方根误差,同时结构相似性也保持在较强水平,说明它不是单纯把图像抹平,而是在降噪和结构保真之间取得了更好的平衡。
表2:无参考指标对比结果
表2:无参考指标对比结果。论文还用了MANIQA、CLIPIQA和MUSIQ这类无参考图像质量指标来补充验证。结果说明,ARVDe不仅在“和真值像不像”上占优,在“人眼看起来舒不舒服”上也比较能打。
表3:消融实验结果
表3:消融实验结果。通过去掉或替换不同模块,可以看到双潜在训练和残差细化器都不是装饰品,而是直接影响最终重建质量的关键零件。尤其是混合解码器从“只吃离散潜变量”变成“离散+连续一起吃”之后,重建质量明显更稳。
从定性图来看,传统CNN方法往往过于平滑,细小血管和边缘会被磨掉;GAN类方法虽然锐利,但偶尔会冒出不该有的伪影,临床上这就很尴尬;Transformer类方法能保住更多全局结构,但如果没有额外的细节补偿,局部纹理依然容易欠账。ARVDe的优势在于,它不是“更像高清图”,而是“更像真实CT”。这俩听着差不多,临床意义却差很多。
实验设计本身也比较合理。首先,使用公开配对数据集,结果可复现;其次,既看有参考指标,也看无参考指标,避免只在一个维度上“刷分”;最后,消融实验把DLHT和残差细化器单独拆出来验证,能够说明提升不是运气好,而是模块设计确实起作用。这里可以给一句实话:这类医学图像论文最怕只放几张漂亮图,ARVDe至少在实验逻辑上是完整的。

未来展望:VDeAR的临床潜力与挑战

这项工作的价值,不只是“又一个去噪模型”。它更像是在提醒医学影像领域:生成式建模并不一定等于胡编乱造,只要条件约束足够强、结构预测足够稳、细节补偿足够谨慎,生成模型也可以做得很临床。
但也别急着把它吹成“医院即插即用”。视觉自回归模型的推理链条比普通卷积网络更长,离散化和逐尺度生成也会带来额外成本。对科研演示来说,这点代价可以接受;对高吞吐临床系统来说,速度、显存占用和稳定性都还得继续打磨。尤其是医学场景,模型只要偶尔出一次错,后果就比普通图像任务严重得多。
更现实的方向,可能是把这类方法和现有临床工作流结合起来,比如作为重建后处理、辅助阅片前增强,或者用于低剂量扫描下的图像质量提升。只要后续能在更多设备、更多病种、更多扫描协议上验证稳定性,这条路线就不只是“论文里很漂亮”,而是真有机会进入实际流程。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是低剂量CT去噪里“降噪”和“保细节”很难兼得的问题。ARVDe用视觉自回归的下一尺度预测先保结构,再用残差细化器补高频细节,尽量减少把病灶一起抹掉的风险。

DLHT是什么意思,为什么要单独设计?DLHT是Dual-Latent Hybrid Training,中文是“双潜在混合训练”。它的作用是让离散潜变量和连续潜变量在训练时对齐,不然自回归分支和解码器分支容易各说各话,推理时就会掉细节。

这类方法能直接上临床吗?还不能直接下结论。它在公开数据集上结果不错,但临床落地还要看速度、跨设备泛化、不同病种稳定性,以及最关键的安全性验证。医学影像里,能跑不算本事,跑得稳、跑得准、跑得可解释,才算真本事。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

视觉自回归搬到低剂量CT去噪里,这个切口挺新,不是简单堆模块,而是把生成范式换了一条路。

实验合理度:★★★★☆

公开数据集、参考和无参考指标、消融实验都齐了,基本能说明结果不是碰运气。

学术研究价值:★★★★☆

对医学图像生成和多潜变量建模都有启发,尤其适合继续往“结构先行、细节补偿”的路线延伸。

稳定性:★★★☆☆

结果看起来稳,但自回归生成链条较长,临床场景里的鲁棒性还需要更多验证。

适应性以及泛化能力:★★★☆☆

公开数据上表现不错,但不同医院、不同扫描协议、不同器官场景下的泛化,还不能只靠这两套数据就下结论。

硬件需求及成本:★★★☆☆

训练和推理都比普通卷积去噪更重,尤其是逐尺度自回归生成,算力和时延都不算轻松。

复现难度:★★★☆☆

方法链条不短,涉及离散编码、Transformer、残差细化器和双潜在训练,细节少一个都可能跑偏。

产品化成熟度:★★★☆☆

作为研究原型很亮眼,作为临床部署方案还需要速度优化、跨域验证和安全性评估。

可能的问题:方法思路完整,但推理成本偏高,临床级稳定性和跨设备泛化还需要更大规模验证。


主要参考文献

[1] Zhang X, Gu Y, Huang Z, et al. Low-Dose CT Denoising via Visual Autoregressive Modeling. arXiv:2606.29198v1, 2026.
[2] Tian K, Jiang Y, Yuan Y, et al. Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction. NeurIPS, 2024.
[3] McCollough C H, Bartley A C, Carter R E, et al. Low Dose CT Grand Challenge 2016. Medical Physics, 2017.
[4] Moen T R, Chen B, Holmes I I I D R, et al. Low Dose CT Image and Projection Data. Medical Physics, 2021.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。