← 返回 PaperDaily 视觉与图像

清华等提出LoTA-N2N:自监督去噪最新SOTA

自监督去噪一直以来都存在一个隐忧:没有干净图像作为目标,构造的代理损失和真正想要的监督损失之间到底差了多少?这篇清华等高校的论文从“迹”差距入手,把各种自监督方法统一到同一个分析框架下,并发现全局迹很小可能掩盖局部大幅正负抵消。为此提出的LoTA-N2N,通过两阶段设计先预训练再局部迹抑制,无需配对数据、无需预知噪声模型,就在21/24个测试设置上拿到零样本

原论文信息如下:
论文标题:
LoTA-N2N: Local Trace Adaptation for Zero-Shot Self-Supervised Image Denoising
发表日期:
2026年7月

发表单位:
清华大学、香港中文大学、南加州大学、北京大学

原文链接:
https://arxiv.org/pdf/2607.24135v1.pdf

1. 自监督去噪的隐忧:迹交互与空间抵消

自监督去噪,顾名思义,就是没有干净图像作为参照,只能从噪声观测中自己学习。听起来很酷,但龙哥一直觉得这事儿有点像盲人摸象——你连真实目标长什么样都不知道,怎么保证模型学对了?
现有方法各显神通:Noise2Noise (N2N) 需要两张独立噪声图,盲点方法(如 Noise2Void)靠跳过中心像素,子图像方法(如 Neighbor2Neighbor)从相邻像素凑对,重噪声方法(如 Recorrupted-to-Recorrupted, R2R)靠假设噪声模型再折腾一遍。但不管怎么绕,它们都在试图让一个叫做 迹交互(Trace Interaction) 的东西消失或变小。
图1:迹修正机制的动机与匹配控制证据。左侧展示了自监督损失、监督损失与迹差距的关系;右侧展示了LoTA-N2N在迭代匹配MSE基线下的每图增益。
图1:迹修正机制的动机与匹配控制证据。左侧展示了自监督损失(Self-supervised Loss)、监督损失(Supervised Loss)与迹差距(Trace gap 2T(θ))的关系;右侧展示了LoTA-N2N在迭代匹配MSE基线下的每图增益。
这篇论文做了件漂亮事:它把几乎所有基于 MSE 的自监督方法统一到了一个数学框架下。简单说,自监督损失 Lss 和监督损失 Lsup 之间差了一个常数 C 和一项 2T(θ)。这个 T(θ) 就是残留误差 r 和预测误差 eθ 之间的内积期望(Frobenius 内积),论文称之为迹(Trace)。具体而言,对于任意一对输入输出 (y, x),若我们定义目标残差 r = y - x 和预测误差 eθ = fθ(y) - x,则迹 T(θ) = E[⟨r, eθ⟩F],其中 ⟨·,·⟩F 表示 Frobenius 内积。这个量直观地度量了模型预测误差与目标残差之间的对齐程度:当迹为零时,自监督损失与监督损失在期望上完全等价;当迹非零时,两者之间存在偏差,且该偏差会直接反映在梯度上。
多数方法努力让 T(θ) 小,但龙哥觉得真正的问题是:全局迹小不代表局部迹小。想象一下,图像里有些区域正相关(+0.8),有些区域负相关(-0.7),一平均可能只剩 0.1 了。这不是问题解决了,而是问题被完美隐藏了。论文把这种现象称为 空间抵消(Spatial Cancellation)。更形式化地说,若将图像划分为 M 个局部区域 {Ωm},则全局迹 T(θ) = (1/M) Σm Tm(θ),其中 Tm(θ) 是第 m 个区域上的局部迹。当不同区域的 Tm(θ) 符号相反时,全局迹的绝对值可能远小于局部迹绝对值的均值,从而掩盖了局部区域上存在的严重偏差。
龙哥看到这里就觉得有意思:大家都盯着全局指标看,谁能想到还有局部正负抵消这回事?这就好比只看平均分,有人科科 80 分,有人有的 100 分有的 60 分,平均分一样但本质完全不同。在去噪任务中,这种空间抵消的后果是:模型可能在平坦区域过度平滑(负迹区域),同时在纹理区域保留噪声(正迹区域),最终全局 PSNR 看起来还行,但视觉质量却大打折扣。
更狠的是,论文还证明了梯度差异完全由迹的梯度决定。具体地,自监督损失梯度 ∇Lss(θ) 与监督损失梯度 ∇Lsup(θ) 之差等于 2∇T(θ)。也就是说,即使某时刻 T(θ) 很小,梯度方向也可能错得离谱——因为梯度差异取决于迹的梯度而非迹本身的大小。这就解释了为什么有些自监督方法看起来损失收敛了,但实际去噪效果并不好——根本原因可能就在于梯度的“方向”被局部交互带偏了,导致优化路径偏离了真正的最优方向。

2. LoTA-N2N:两阶段局部迹自适应框架

既然全局迹可能骗人,那干脆就别看全局了,直接局部动手!这就是 LoTA-N2N 的核心思路:在局部区域(比如 4×4 的块)上估计并压制交互迹的绝对值,防止正负抵消。这个框架分为两个阶段,整体流程如图2所示。
图2:LoTA-N2N的整体管线。阶段一使用双向子图像MSE预训练去噪器,并冻结教师模型生成分离的干净子图像代理;阶段二使用这些代理估计局部迹交互并压制其幅度。
图2:LoTA-N2N的整体管线。阶段一使用双向子图像MSE预训练去噪器,并冻结教师模型生成分离的干净子图像代理;阶段二使用这些代理估计局部迹交互并压制其幅度。
阶段一:MSE预训练与干净估计
给定一张噪声图像 y,首先通过互补采样生成两个子图像 y1 和 y2。采样方式很简单:用 2×2 的采样核对原图进行下采样,k1 取左上角像素,k2 取右下角像素,构成互补对。这种采样方式保证了 y1 和 y2 在空间上不重叠,从而使得它们包含的噪声近似独立——这是子图像方法能够工作的关键前提。具体地,若原图尺寸为 H×W,则子图像尺寸为 H/2 × W/2,每个子图像仅包含原图中一半的像素。
然后训练一个轻量去噪器 fθ,让它同时做两件事:从 y1 预测 y2,以及从 y2 预测 y1。这就是双向子图像MSE。损失函数为 Lstage1 = E[||fθ(y1) - y2||² + ||fθ(y2) - y1||²]。由于 y1 和 y2 共享相同的干净图像 x 但噪声独立,这个损失在期望上等价于监督损失加上一个常数项,因此预训练得到的模型 fθ0 可以作为干净图像的一个合理估计器。训练完后,将完整的噪声图像 y 输入这个预训练模型 fθ0,得到全图估计 x̂ = fθ0(y)。再用采样核从估计图中切出对应的干净子图像 x̂1 和 x̂2,并记作“分离”(detached),即不参与第二阶段的反向传播。这里的关键是:x̂1 和 x̂2 作为 x1 和 x2 的代理,其质量直接决定了后续迹估计的准确性。
阶段二:局部低迹适应
这个阶段才是真正的精华。模型从头开始重新训练(但用阶段一的权重初始化),优化目标由两部分组成:
第一部分是标准的子图像MSE重建损失 LMSE = E[||fθ(y1) - y2||² + ||fθ(y2) - y1||²],保证模型能预测准噪声图。第二部分是创新的局部迹约束(Local Trace Constraint, LTrC) LLTrC = (1/M) Σm |T̂m(θ)|,其中 T̂m(θ) 是在第 m 个局部区域上估计的迹,M 是区域总数。论文将图像划分为不重叠的 4×4 块,在每个块上独立计算迹估计。
关键是怎么算这个迹。论文用阶段一生成的分离干净估计 x̂i 代替真正的干净图像 xi,计算目标残差 r̂ = yj - x̂i 和预测误差 p̂θ = fθ(yi) - x̂i,然后两者的内积就是估计的迹:T̂(θ) = ⟨r̂, p̂θ⟩F。由于用了分离梯度(stop-gradient),x̂i 在阶段二不会被更新,这就保证了迹估计的稳定性和可分析性。注意这里 i 和 j 是互补的:当输入是 y1 时,目标用 y2 的残差;反之亦然。这种交叉设计确保了残差和预测误差在统计上的独立性。
论文还证明了这样做的好处:局部迹绝对值的和,天然控制了全局迹的绝对值(这就是空间抵消控制)。具体地,由三角不等式可知 |T(θ)| ≤ (1/M) Σm |Tm(θ)|,因此最小化局部迹绝对值之和必然迫使全局迹的绝对值也变小。而且通过建立监督风险上界,论文从理论上保证了只要教师模型的质量足够好(即估计误差 ϵ 小),这个局部迹约束就能有效降低真实监督损失和自监督损失之间的鸿沟。论文导出的上界为:Lsup(θ) ≤ Lss(θ) + C + 2(1/M) Σm |Tm(θ)| + O(ϵ),其中 ϵ 是教师模型的估计误差。
最终的适应目标是:Lft = LMSE + λv LLTrC,其中 λv 使用余弦退火调度,并在验证集上选择初始值和最小值(论文最终使用的权重下界是 0.15)。余弦退火调度意味着 λv 从初始值开始,随着训练步数增加逐渐减小到最小值,这样在训练早期强约束引导方向,后期弱约束允许精细调整。论文通过验证集上的网格搜索确定初始 λv 为 0.5,最小值 0.15。

3. 实验表现:21/24最优,跨域稳定

论文的实验设计非常扎实。首先在标准自然图像数据集(Kodak24、McMaster18、Set14、Set5)上,对比了四种噪声类型(高斯、泊松、混合泊松-高斯噪声)和多个强度级别下的表现。对比方法包括离线监督方法(DnCNN、N2N)、在线非学习方法(CBM3D、DIP2000)和多种自监督方法(Noise2Self、Noise2Fast、ZSN2N)。所有对比方法均使用作者提供的官方代码或重新实现,并在相同的数据划分和评估协议下进行测试,确保了公平性。
表2:不同去噪方法在Kodak24、McMaster18、Set14和Set5上的定量对比。评估指标为PSNR(dB)。每个设置下离线最好结果和在线最好结果分别以粗体标出。
表2:不同去噪方法在Kodak24、McMaster18、Set14和Set5上的定量对比。评估指标为PSNR(dB)。每个设置下离线最好结果和在线最好结果分别以粗体标出。在混合噪声块中,p 表示泊松峰值,r 表示 0-255 灰度尺度上的高斯读数噪声标准差。
来看结果:在 24 个在线设置中,LoTA-N2N 拿到了 21 个最优(剩余 3 个也基本是第二)。特别是在最具挑战性的混合噪声设置中,相比表现最好的竞品 ZSN2N,LoTA-N2N 在 Kodak24 数据集上平均高出 0.3-0.4 dB。在 McMaster18 上收益更明显,混合噪声下最高提升 0.5 dB 以上。例如,在泊松峰值 p=30、高斯读数噪声 r=10 的设置下,LoTA-N2N 在 McMaster18 上达到 31.27 dB,而 ZSN2N 仅为 30.74 dB。
值得注意的是,论文特意设置了迭代匹配控制(Iteration-Matched Control)实验:在 McMaster18 上,LoTA-N2N 的最终结果与使用相同阶段一预训练、相同迭代步数的纯 MSE 微调对比。结果显示,在每张图上 LoTA-N2N 都赢了,18/18 全胜。这说明收益不是来自更多优化,而是来自局部迹约束的独特贡献。具体地,纯 MSE 微调在 800 步后的平均 PSNR 为 30.85 dB,而 LoTA-N2N 达到 31.27 dB,提升 0.42 dB。
跨域实验同样令人信服。论文在共聚焦显微镜图像(FMD 数据集)和儿科胸部 X 光图像上做了测试,LoTA-N2N 在所有设置中均取得最佳或并列最佳。尤其在高斯噪声 σ=10 的 X 光图像上,比第二名 ZSN2N 高 0.68 dB,差距相当明显。在 FMD 数据集上,LoTA-N2N 在泊松噪声下的平均 PSNR 为 32.15 dB,而 ZSN2N 为 31.72 dB。这些结果充分证明了 LoTA-N2N 的跨域泛化能力。
表3:不同去噪方法在共聚焦和X射线数据集上的定量对比。评估指标为PSNR(dB),每个设置下最好结果以粗体标出。LoTA-N2N 使用最终下界 0.15 配置。
表3:不同去噪方法在共聚焦和X射线数据集上的定量对比。评估指标为PSNR(dB),每个设置下最好结果以粗体标出。LoTA-N2N 使用最终下界 0.15 配置。

4. 机制解析:局部迹抑制是核心

如果只看 PSNR 数字,可能会觉得 LoTA-N2N 只是又刷了个点。但龙哥觉得真正有价值的是论文对“为什么有效”的深入分析。
迹与梯度的诊断
论文设计了一套诊断实验:在训练过程中同时监控全局迹(Global Trace)、局部迹绝对值(Local Trace Magnitude)和梯度迹(Gradient Trace)。结果非常清晰:LoTA-N2N 的局部迹绝对值始终低于 MSE 基线,且差异在训练后期更加明显。例如,在训练 800 步后,MSE 基线的局部迹绝对值为 0.023,而 LoTA-N2N 仅为 0.011,降低了约 52%。更关键的是,梯度迹的差异也被有效缩小了——MSE 基线的梯度迹为 0.008,LoTA-N2N 为 0.003,这意味着局部迹约束确实在帮助优化器走对方向。
图:迹与梯度诊断实验结果。显示了LoTA-N2N与MSE基线在全局迹、局部迹绝对值和梯度迹上的对比,证明局部迹抑制能有效降低梯度差异。
图:迹与梯度诊断实验结果。显示了LoTA-N2N与MSE基线在全局迹、局部迹绝对值和梯度迹上的对比,证明局部迹抑制能有效降低梯度差异。
教师质量的影响
既然阶段一的教师模型直接决定了迹估计的准确性,那么教师质量如果很差会怎样?论文做了消融实验:使用不同量的阶段一训练迭代(500-3000 步),然后看阶段二的表现。结果发现,即使教师只训练了 500 步(PSNR 只有 28 dB 左右),阶段二依然能带来 0.5 dB 以上的提升。这说明方法对教师质量具有一定的鲁棒性。当教师训练 1000 步(PSNR 约 29.5 dB)时,阶段二提升约 0.6 dB;训练 3000 步(PSNR 约 30.2 dB)时,提升约 0.7 dB。
当然,论文也很诚实地指出,当教师太差时(比如 300 步以内),阶段二的提升就会大大减弱,甚至不如直接多跑几轮 MSE 微调。这一点从理论上也能解释:在导出的监督风险上界中,有一个显式的估计误差项 ∆T ≤ ϵ(P+Q)+ϵ²,当 ϵ(教师估计误差)变大时,上界就会变松,局部迹约束的有效性也随之下降。具体地,当教师 PSNR 低于 27 dB 时,阶段二的提升降至 0.2 dB 以下。
噪声偏移测试
如果噪声假设被违反会怎样?论文设计了噪声偏移测试:在训练时假设 σ=20,但测试噪声实际是 σ=10、15、25、30。结果显示,LoTA-N2N 在所有偏移下都比 MSE 基线好,且优势在噪声更大时反而更明显。例如,当测试噪声 σ=30 时,LoTA-N2N 比 MSE 基线高 0.55 dB;而当 σ=10 时,优势为 0.30 dB。这表明局部迹约束不仅仅是在“匹配”噪声模型,而是在更根本地抑制预测与残留之间的相关结构。这种鲁棒性在实际应用中非常重要,因为真实噪声的强度往往难以精确预知。

5. 局限与展望:相关噪声仍是边界

龙哥最欣赏这篇论文的一点是,作者没有吹得天花乱坠,而是公开讨论了方法的边界条件。
相关噪声:真正的挑战
当噪声在空间上存在相关性时(比如低频噪声、条带噪声),互补子图像的假设就开始出问题。因为如果噪声是相关的,那么在 2×2 块内选左上和右下,它们包含的噪声就不再独立了。这会直接破坏子图像方法的根基——因为子图像 MSE 损失在噪声相关时不再等价于监督损失,其偏差会随着相关长度的增加而增大。
论文在实验部分专门对此做了压力测试:使用不同空间相关长度的噪声(从 0 到 5 像素)。当相关长度为 0(独立噪声)时,LoTA-N2N 提升 0.8 dB;相关长度 1 时,提升降至 0.3 dB;相关长度 2 时,基本持平;再往上就略有退步了。具体地,相关长度 3 时退步 0.1 dB,相关长度 5 时退步 0.3 dB。这个结果非常诚实:LoTA-N2N 不是万能药,在处理相关噪声时需要谨慎。这也提示用户在实际应用中,如果预知噪声具有显著的空间相关性,可能需要先进行去相关预处理,或者考虑其他更适合的基线方法。
未来的改进方向
论文承认,当前方法本质上仍然依赖于子图像的空间冗余。在高度重复或纹理稀疏的区域,子图像估计本身就不可靠。未来的方向可能包括:
1)使用更灵活的采样模式(而不是固定的 2×2 互补采样)来适应不同噪声类型,例如根据局部噪声特性自适应选择采样间距;
2)将局部迹约束与其他自监督范式(如盲点、重噪声)结合,发挥多重机制的优势,例如在盲点方法中引入局部迹约束来进一步抑制偏差;
3)在阶段一的教师设计上做改进,比如使用多教师投票或迭代式教师更新来提升估计精度,或者引入自集成策略来获得更稳定的干净估计。
龙哥觉得,LoTA-N2N 最大的贡献不是刷了多少个点,而是提供了一个新的视角:与其费力去构造完美的无偏代理目标,不如直接估计并压制局部偏差。这个思路在自监督学习普遍面临“代理任务与真实任务不对齐”的痛点时,非常值得借鉴。它启示我们,在无法获得完美监督信号的情况下,主动识别并抑制偏差的来源,可能比被动地接受代理目标更为有效。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

Q1: 论文中提到的“迹”(Trace)到底是什么?和线性代数中的迹一样吗?A1: 不是完全一样。论文中的“迹”特指 Frobenius 内积,即两个矩阵对应元素乘积之和,然后取期望均值。如果两个矩阵都是向量化的,这个内积就等于点积(Dot Product)。在自监督学习的语境下,它是目标残留 r 和预测误差 eθ 之间的“相关性度量”。当这个迹为零时,自监督损失和一个可实现的监督损失完全等价。与线性代数中矩阵迹(对角线元素之和)的区别在于,这里的迹是随机变量的期望内积,而非确定性矩阵的迹。

Q2: LoTA-N2N 里的“分离梯度”或“stop-gradient”是什么意思?为什么要这样设计?A2: “分离梯度”(Stop-Gradient, sg)是指在反向传播时不让某个变量的梯度继续传递。在 LoTA-N2N 中,阶段一冻结的教师模型产生的估计 x̂i 在阶段二被视为常数,不参与梯度计算。这样做的目的是:1)防止教师模型的估计值被阶段二优化“污染”或“偏移”,保持迹估计来源的纯净性;2)让迹估计的来源保持固定,便于推导监督风险上界。简单说,就是把教师当成一个固定不变的“参考黑盒子”,只许学生去适应它,不许学生反过来改它。如果去掉 stop-gradient,教师估计会随着学生更新而漂移,导致迹估计失去稳定的参考基准,实验表明这会使 PSNR 下降约 0.2 dB。

Q3: 既然 LoTA-N2N 是零样本(Zero-shot)方法,它需要像 DnCNN 那样在其他数据集上预训练吗?A3: 不需要。所谓“零样本”是指针对每一张测试图像独立进行迭代优化,不需要任何外部训练数据。阶段一的预训练也是在这张噪声图像内部完成的(使用互补子图像对),所以整个过程不依赖任何外部干净图像或大规模训练集。但需要指出的是,LoTA-N2N 在推理时需要多次迭代优化(阶段一约 3000 步,阶段二约 800 步),所以推理速度较慢。这是所有基于优化(而非单次前馈)的零样本方法的共同代价。在单张 NVIDIA V100 GPU 上,处理一张 512×512 的图像大约需要 2-3 分钟。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将迹交互与空间抵消的自监督理论整合统一,并据此提出全新的局部迹约束范式。不是简单的改进,而是对自监督去噪本质认识的深化。

实验合理度:★★★★★

实验设计非常全面且严谨:迭代匹配控制、教师质量消融、噪声偏移测试、梯度诊断、配对统计检验,该有的都有。且对比基线均重新复现,使用同一数据流,公平性令人信服。

学术研究价值:★★★★★

将各种自监督方法统一到迹交互框架下,这一理论贡献本身就极具价值。还为解决代理目标对齐问题提供了新思路,预计将被大量引用。

稳定性:★★★★✰

在独立噪声和混合噪声下非常稳定,迭代匹配控制全胜证明收益来自机制而非随机。但相关噪声下会出现退化,需要使用者注意噪声特性。

适应性以及泛化能力:★★★★✰

能在自然图像、医学图像、显微镜图像上稳定工作,跨域能力不错。但对相关噪声的适应性较弱,这是子图像方法的固有限制。

硬件需求及成本:★★★✰✰

每张图需要 3000 步预训练 + 800 步适应,推理时间较长。但模型本身很小(3×3 卷积网络),GPU 内存需求不高,适合单图离线处理。

复现难度:★★★✰✰

论文详细描述了采样、损失函数、调度策略等关键细节,但在撰写本文时尚未看到官方开源代码。整体实现复杂度中等,但需自行实现教师冻结和迹估计模块。

产品化成熟度:★★✰✰✰

零样本方法单图推理耗时较长,不适合实时场景。在医学和显微镜等离线处理需求中可能有应用,但整体成熟度待提升。

可能的问题:领域标定可能稍显保守。真实世界的相机噪声往往是泊松-高斯混合且可能有相关成分,这个方法在实践中需要预先判断噪声是否适合。另外,阶段一和阶段二的优化步数选取需要验证集或经验,降低了盲操作即用的便利性。


主要参考文献

[1] Lehtinen, J., et al. "Noise2Noise: Learning Image Restoration without Clean Data." ICML 2018.
[2] Krull, A., et al. "Noise2Void: Learning Denoising from Single Noisy Images." CVPR 2019.
[3] Huang, T., et al. "Neighbor2Neighbor: Self-Supervised Denoising from Single Noisy Images." CVPR 2021.
[4] Mansour, Y., & Heckel, R. "Zero-Shot Noise2Noise." TPAMI 2023.
[5] Batson, J., & Royer, L. "Noise2Self: Blind Denoising by Self-Supervision." ICML 2019.
[6] Xie, Y., et al. "Noise2Same: A Self-Supervised Learning Framework for Image Denoising." NeurIPS 2020.
[7] Hu, J., et al. "LoTA-N2N: Local Trace Adaptation for Zero-Shot Self-Supervised Image Denoising." arXiv 2607.24135v1, 2026.


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
噪声虽杂,迹可追踪;LoTA-N2N,局部修正。想系统掌握自监督去噪的前沿理论与实战代码?扫码加入龙哥粉丝群,与三千同道一起拆解新论文!
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球