← 返回 PaperDaily
视觉与图像
上海交大等提出VDeAR:LDCT去噪首次用上视觉自回归,细节更稳
低剂量CT去噪最怕两件事:一是把噪声抹掉,二是把病灶也顺手抹掉。VDeAR偏偏换了个思路,用视觉自回归做下一尺度预测,再拿残差细化器补高频细节,思路挺新,结果也挺能打。
龙哥读论文
发布于 2026-08-14 09:10:58
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 低剂量CT去噪最怕两件事:一是把噪声抹掉,二是把病灶也顺手抹掉。VDeAR偏偏换了个思路,用视觉自回归做下一尺度预测,再拿残差细化器补高频细节,思路挺新,结果也挺能打。
原论文信息如下:
LDCT去噪的新范式:视觉自回归模型如何突破瓶颈?
低剂量CT去噪这件事,表面上是“把噪声去掉”,实际上更像在和医生抢细节:噪声没了,病灶也别跟着没了。传统卷积网络常常把图像抹得太平,GAN又容易为了“好看”乱编细节,Transformer能看全局,但怎么把粗糙结果一层层修到临床可用,仍然是个老大难。
这篇论文直接换了一个路子:把视觉自回归模型 搬到低剂量CT去噪里,用“下一尺度预测”代替一次性生成。说人话就是,不再一口气猜完整张图,而是先把结构骨架搭出来,再逐层补细节,像修图时先打底再精修,而不是上来就狂按美颜滤镜。
这套方法的名字是ARVDe ,全称是Visual Autoregressive Modeling for Low-Dose CT Denoising ,中文可以理解为“用于低剂量CT去噪的视觉自回归建模”。其中,AR 是Autoregressive,中文叫“自回归”;NDCT 是Normal-Dose CT,中文叫“正常剂量CT”;LDCT 是Low-Dose CT,中文叫“低剂量CT”。这些缩写不复杂,但很关键,因为整篇论文的逻辑就是:用LDCT作为条件,去生成更接近NDCT的结果。
从全局到局部:下一尺度预测的核心原理
这篇工作的核心,不是简单把“生成模型”四个字贴到CT上,而是认真回答了一个问题:临床图像到底该怎么生成,才既像真图,又不乱补细节? 答案是:先让模型看到全局,再让它一点点往局部细节走。
图2:自回归Transformer与残差细化器示意图。左侧展示了双潜在训练策略,右侧展示了带残差细化器的自回归Transformer。前者负责让离散潜变量和连续潜变量“说同一种语言”,后者负责把量化丢掉的高频细节补回来。
先看整体流程。输入一张低剂量CT,编码器会把它压成一串“前缀token”。这里的token不是聊天机器人那种词元,而是图像被切块、离散化后得到的表示。模型把这些前缀token当作条件信息,像拿着地图和起点坐标一样,去预测正常剂量CT的离散token地图。这里用的是下一尺度预测 ,英文叫next-scale prediction ,意思不是逐像素“补字”,而是先预测低分辨率结构,再逐步扩展到更细尺度。
这一步为什么重要?因为CT图像不是普通照片。普通照片里多一点纹理,少一点纹理,可能只是“看着不够高级”;但CT里多一点假结构,少一点小血管、小结节,代价就是诊断风险。下一尺度预测的好处在于,它先保证全局结构稳定,再逐层恢复局部细节,比“从噪声里一把梭”更符合医学图像的生成规律。
论文里还有一个很关键的设计:LDCT前缀token始终可见 。这相当于给模型一个稳定的条件锚点,避免它在多尺度生成中“越走越偏”。如果没有这个锚点,模型很容易在细节层面开始自由发挥,最后就会出现医学图像最怕的那种情况:看起来挺清楚,实际上不一定对。
从实现上看,Transformer负责建模离散token之间的依赖关系,尤其擅长捕捉长程结构一致性。对于CT这种“整体轮廓不能乱、局部纹理也不能丢”的任务,这种全局建模能力比纯卷积更自然。论文的做法不是把Transformer当万能药,而是让它负责最擅长的部分:先把结构关系理顺,再把最难啃的高频信息交给后面的细化模块。
残差细化器与双潜在训练:如何挽救丢失的高频细节?
视觉自回归模型有个天然短板:离散化会丢信息 。这不是模型不努力,而是量化这一步本身就像把彩色照片压成低码率图片,边缘、纹理、细小结构多少会被损掉。对自然图像来说,这个损失可能还能靠“看着差不多”糊过去;但对CT图像来说,糊过去可不行。
所以论文额外加了一个残差细化器 。它的作用很直白:不去重新生成整张图,只去补“离散表示和连续表示之间的差额”。这个差额可以理解为量化后没能保住的那部分高频信息,比如细血管边缘、微弱组织纹理、局部锐利轮廓。模型先生成一个基础版本,再用残差细化器做精修,思路上比“从头到尾都靠离散token硬扛”靠谱得多。
这里还有一个更工程化的设计,叫双潜在训练 ,英文是Dual-Latent Hybrid Training, DLHT 。所谓“双潜在”,就是同时处理离散潜变量和连续潜变量。离散潜变量更适合自回归建模,连续潜变量更适合保留细腻纹理。难点在于,这两种表示天生不是一回事,训练时如果各干各的,推理时就容易“语言不通”。DLHT的作用,就是强行把这两种表示对齐,让混合解码器在推理时能同时吃到两边的好处。
如果把整个方法拆成一句大白话,那就是:Transformer负责“先想对”,残差细化器负责“再修细”,双潜在训练负责“让两种修法不打架”。 这三件事缺一都不太行。只靠Transformer,容易细节不够;只靠细化器,容易全局不稳;只靠离散表示,容易丢高频。论文的聪明之处,在于没有迷信单一路线,而是把生成、修复、对齐三件事拆开做。
从论文的训练思路看,模型不是简单端到端喂数据,而是先让混合解码器学会在离散和连续空间之间切换,再让残差细化器补上量化损失。这个顺序很重要。很多方法的问题不是模块不强,而是训练顺序不对,结果就是模块各自很能打,拼起来却像临时拼桌,谁也不服谁。
实验表现:全面领先的定量与定性结果
实验部分没有玩虚的,直接上了两个公开数据集:Ma-2016 和 Ma-2020 。前者来自低剂量CT挑战赛,后者来自低剂量CT图像与投影数据集。数据都是配对的低剂量/正常剂量CT,适合检验去噪是否真的把图像往正确方向拉,而不是往“看起来顺眼”的方向乱拽。
从定性图来看,传统CNN方法往往过于平滑,细小血管和边缘会被磨掉;GAN类方法虽然锐利,但偶尔会冒出不该有的伪影,临床上这就很尴尬;Transformer类方法能保住更多全局结构,但如果没有额外的细节补偿,局部纹理依然容易欠账。ARVDe的优势在于,它不是“更像高清图”,而是“更像真实CT”。这俩听着差不多,临床意义却差很多。
实验设计本身也比较合理。首先,使用公开配对数据集,结果可复现;其次,既看有参考指标,也看无参考指标,避免只在一个维度上“刷分”;最后,消融实验把DLHT和残差细化器单独拆出来验证,能够说明提升不是运气好,而是模块设计确实起作用。这里可以给一句实话:这类医学图像论文最怕只放几张漂亮图,ARVDe至少在实验逻辑上是完整的。
未来展望:VDeAR的临床潜力与挑战
这项工作的价值,不只是“又一个去噪模型”。它更像是在提醒医学影像领域:生成式建模并不一定等于胡编乱造 ,只要条件约束足够强、结构预测足够稳、细节补偿足够谨慎,生成模型也可以做得很临床。
但也别急着把它吹成“医院即插即用”。视觉自回归模型的推理链条比普通卷积网络更长,离散化和逐尺度生成也会带来额外成本。对科研演示来说,这点代价可以接受;对高吞吐临床系统来说,速度、显存占用和稳定性都还得继续打磨。尤其是医学场景,模型只要偶尔出一次错,后果就比普通图像任务严重得多。
更现实的方向,可能是把这类方法和现有临床工作流结合起来,比如作为重建后处理、辅助阅片前增强,或者用于低剂量扫描下的图像质量提升。只要后续能在更多设备、更多病种、更多扫描协议上验证稳定性,这条路线就不只是“论文里很漂亮”,而是真有机会进入实际流程。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是低剂量CT去噪里“降噪”和“保细节”很难兼得的问题。ARVDe用视觉自回归的下一尺度预测先保结构,再用残差细化器补高频细节,尽量减少把病灶一起抹掉的风险。
DLHT是什么意思,为什么要单独设计? DLHT是Dual-Latent Hybrid Training,中文是“双潜在混合训练”。它的作用是让离散潜变量和连续潜变量在训练时对齐,不然自回归分支和解码器分支容易各说各话,推理时就会掉细节。
这类方法能直接上临床吗? 还不能直接下结论。它在公开数据集上结果不错,但临床落地还要看速度、跨设备泛化、不同病种稳定性,以及最关键的安全性验证。医学影像里,能跑不算本事,跑得稳、跑得准、跑得可解释,才算真本事。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
视觉自回归搬到低剂量CT去噪里,这个切口挺新,不是简单堆模块,而是把生成范式换了一条路。
实验合理度: ★★★★☆
公开数据集、参考和无参考指标、消融实验都齐了,基本能说明结果不是碰运气。
学术研究价值: ★★★★☆
对医学图像生成和多潜变量建模都有启发,尤其适合继续往“结构先行、细节补偿”的路线延伸。
稳定性: ★★★☆☆
结果看起来稳,但自回归生成链条较长,临床场景里的鲁棒性还需要更多验证。
适应性以及泛化能力: ★★★☆☆
公开数据上表现不错,但不同医院、不同扫描协议、不同器官场景下的泛化,还不能只靠这两套数据就下结论。
硬件需求及成本: ★★★☆☆
训练和推理都比普通卷积去噪更重,尤其是逐尺度自回归生成,算力和时延都不算轻松。
复现难度: ★★★☆☆
方法链条不短,涉及离散编码、Transformer、残差细化器和双潜在训练,细节少一个都可能跑偏。
产品化成熟度: ★★★☆☆
作为研究原型很亮眼,作为临床部署方案还需要速度优化、跨域验证和安全性评估。
可能的问题: 方法思路完整,但推理成本偏高,临床级稳定性和跨设备泛化还需要更大规模验证。
主要参考文献
[1] Zhang X, Gu Y, Huang Z, et al. Low-Dose CT Denoising via Visual Autoregressive Modeling. arXiv:2606.29198v1, 2026.
[2] Tian K, Jiang Y, Yuan Y, et al. Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction. NeurIPS, 2024.
[3] McCollough C H, Bartley A C, Carter R E, et al. Low Dose CT Grand Challenge 2016. Medical Physics, 2017.
[4] Moen T R, Chen B, Holmes I I I D R, et al. Low Dose CT Image and Projection Data. Medical Physics, 2021.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!