← 返回 PaperDaily 视觉与图像

身份相似度0.988!四校联手端出免训练人脸修复新范式

手机里存了三年的糊脸照片,AI一顿猛修,结果亲妈都不认得了?扩散模型人脸修复最怕"五官漂移",南邮等四校带来WaveFreqAnchor:零训练、零微调,只用波结构锚定+频率校正,把身份相似度一路抬到0.988,修完还像本人!

身份相似度0.988!四校联手端出免训练人脸修复新范式
原论文信息如下:

论文标题:
WaveFreqAnchor: Wave-Structural Anchoring and Frequency Correction Diffusion for Training-Free Face Restoration

发表日期:
2026年8月

发表单位:
南京邮电大学、北京邮电大学、南京理工大学、华东师范大学

原文链接:
https://arxiv.org/pdf/2608.06717v1.pdf

想象一下这个场景:手机里翻出一张十年前的合影,人脸早已模糊成一团色块。打开某个“AI修复”小程序,几秒钟后照片“高清”了,可仔细一看——这位大眼睛高鼻梁的美女,到底是谁啊?
这不是段子,而是人脸修复领域一个极其普遍的翻车现场,业内把它叫做“身份漂移”(identity drift)。严重退化下,输入图像只留下模糊的五官轮廓和非常有限的身份线索,模型一通脑补之后,细节是逼真了,可五官位置、比例、特征全跑偏了,亲妈都认不出。
现有方案里,基于GAN先验的方法容易走向“模板化”,基于离散码本的又受限于码本表达能力,扩散模型虽然能生成细腻逼真的面部细节,但在严重退化下同样有可能被“带跑偏”。更麻烦的是,真实世界的退化算子往往是未知的,模型很难精确建模退化过程,反向采样轨迹一不小心就偏离了观测所支持的底层面部结构。
南京邮电大学、北京邮电大学、南京理工大学、华东师范大学联合提出了WaveFreqAnchor——一个完全免训练的人脸修复框架。它的核心思路非常直接:扩散模型不是擅长脑补吗?那就在逆向采样过程中,用观测图像本身的结构信息和频率信息,给它装上一个“结构导航系统”,从源头防止脑补跑偏。

人脸修复的“身份漂移”难题

先来看看困难到底出在哪里。人脸修复本质上是一个极度不适定(ill-posed)的反问题:退化越严重,可能对应的高清解就越多,模型随便挑一个“看起来合理”但跟本人完全不像的结果,实在是太容易了。
目前主流的人脸修复方法大致分两类:一类是依赖任务特定训练的前馈方法,比如DiffBIR、OSDFace、FiDeSR,它们需要针对退化类型专门训练,计算开销不小;另一类是后验采样方法,比如DPS、SubDAPS++,它们借助预训练扩散模型,在反向采样过程中加入降质算子约束,无需重新训练。后一类方法在已知退化算子时表现不错,但一遇到严重退化,观测输入能提供的结构线索太少,采样轨迹就容易漂移。
这里有个很有价值的观察:小波域表示天然适合做人脸结构约束。图像经过小波分解之后,低频子带保留的是粗略的面部结构,而其中的傅里叶相位又编码了关键的空间位置信息,即使在严重退化下也相对稳定。高频子带则承载着方向性边缘和细腻纹理,但观测到的响应往往较弱、不可靠。
换句话说:低频结构应该紧紧贴住观测,高频细节则交给扩散模型生成,在必要时做受控增强。WaveFreqAnchor的三大组件——ASWG、MWFI、SHE——正是围绕这一原则设计的。
图1:WaveFreqAnchor方法总览
WaveFreqAnchor方法总览。给定输入观测,ASWG为后验采样提供梯度引导,MWFI用观测相位校正预测的低频小波子带并保留引导更新后的高频子带。对于高频细节缺失的真实世界输入,SHE在后验更新前进一步细化预测的高频子带。

波结构锚定:给扩散模型装上“结构导航”

ASWG的全称是Anchor-Space Wave-Structural Guidance,即锚定空间波结构引导。它的想法是这样的:把当前预测的干净图像投影到一个低分辨率锚定空间,在这个空间里跟观测图像做结构一致性约束。为什么要这么做?因为低分辨率空间里细节不可靠,但整体轮廓、五官布局这些粗粒度结构相对可信,约束它们更不容易被高频噪声干扰。
锚定空间怎么选?合成超分里,锚定分辨率就是真实的低分辨率尺寸(比如16倍下采样后是16×16);真实世界修复里,则由频率比路由器决定。设 A(·) 表示锚定下采样操作,在时间步t,预测的干净图像 x̂₀|ₜ 被投影到锚定尺度得到 uₜ:
公式:锚定投影
uₜ = A(x̂₀|ₜ),表示把当前预测的干净图像下采样到锚定分辨率。
然后定义像素锚定损失:
公式:像素锚定损失
L_pixel = ‖uₜ − u_y‖₂。u_y 对合成超分就是真实的低分辨率图像,对真实世界修复就是锚定采样后的观测。
但像素级L2损失本质上只是逐点对齐,并没有显式描述结构差异。所以ASWG引入了一个“波结构损失”——受波动方程视觉建模启发,对两幅图像施加相同的固定波算子,用波响应差异来度量结构差异。这里的波算子不是训练出来的视觉主干,它只是一个固定的结构描述子。
具体来说,设u为锚定空间中的图像,先计算离散拉普拉斯响应作为波动力学的初始速度:
公式:拉普拉斯初始速度
v₀ = ∇²_d u = K_Δ ∗ u,U = F(u),V = F(v₀)。K_Δ 是固定的3×3八邻域离散拉普拉斯核,v₀编码局部边缘响应,F表示快速傅里叶变换。
然后定义阻尼各向异性频率:
公式:阻尼各向异性频率
ω_d(k_x, k_y) = √(v_x²k_x² + v_y²k_y² − (α/2)²)。k_x、k_y是空间频率坐标,v_x和v_y是两个方向上的固定传播速度,α是阻尼系数。两个方向用不同传播速度,就能得到方向相关的结构响应,这就是“各向异性”的由来。
最终波响应写成:
公式:波响应
φ(u) = F⁻¹[ e^(−ατ/2) ( U cos(ω_dτ) + (V + αU/2)/(ω_d+ε) sin(ω_dτ) ) ]。τ是传播时间,ε防止除零。
波结构损失就是:
公式:波结构损失
L_wave = ‖φ(uₜ) − φ(u_y)‖₂,两幅图像各自经过相同波算子后的响应差异越小,说明结构越接近。
总引导目标合并为:
公式:总引导目标
L_total = L_pixel + λ_t L_wave。在反向采样时,对L_total求梯度并归一化,就得到后验更新的引导方向。
整个采样从带噪观测出发而非纯高斯噪声:
公式:带噪观测初始化
x_{t_s} = √ᾱ_{t_s} y + √(1−ᾱ_{t_s}) ε。从观测y出发加噪到起始时间步t_s,保留了粗略的面部结构、姿态和布局,同时给扩散模型留出补全细节的空间。
引导更新公式如下:
公式:引导后验更新
x̃_{t−1} = μₜ(xₜ, x̂₀|ₜ) − ζₜ g̃ₜ + σₜ ε。μₜ是后验均值,ζₜ是引导强度,g̃ₜ是归一化后的引导梯度。
公式:归一化梯度
g̃ₜ = ∇_{xₜ}L_total / max(‖∇_{xₜ}L_total‖₂, 1) + ε_g。梯度归一化防止异常的梯度幅值破坏采样稳定性。

频率校正:让低频结构“不跑偏”

ASWG在锚定空间约束了粗略结构,但扩散模型在逆向采样过程中逐步预测的干净图像,低频部分仍然可能偏离观测。MWFI(Multi-scale Wavelet-Fourier Injection,多尺度小波-傅里叶注入)专门解决这个问题。
先说一个经典的信号处理结论:傅里叶相位携带了大部分空间结构信息(Oppenheim and Lim 1981)。举个经典的例子——把一张猫和一张狗的图像做傅里叶变换,交换它们的幅值、保留各自的相位,重构出来还是各自原来的物种。也就是说,幅值主要影响整体对比度和亮度,而相位决定了关键的空间结构。
MWFI的做法很直接:对观测图像做J级Haar小波分解,取低频子带LL_y,计算它的傅里叶相位。在每一步采样时,把当前预测的干净图像也做同样的J级小波分解,得到预测的低频傅里叶表示:
公式:预测低频傅里叶表示
F(LL_{x̂₀|ₜ}) = Aₜ exp(iφₜ)。Aₜ是预测幅值,φₜ是预测相位。
按照相位比幅值更重要的原则,保留预测的幅值Aₜ,但把预测相位替换成观测相位φ_y:
公式:低频相位替换
LL_corr = F⁻¹(Aₜ exp(iφ_y))。只换相位、不换幅值,既把观测的结构信息注入进去,又不丢失预测的整体强度分布。
校正后的低频子带通过前向扩散过程加噪到当前时间步,然后从后验更新后的x̃_{t−1}里提取高频子带,和校正后的低频子带重组:
公式:低频子带加噪
LLₜ_corr = √ᾱₜ LL_corr + √(1−ᾱₜ) εₜ,将校正后的低频信息对齐到当前噪声级别。
公式:小波重组
x_{t−1} = IDWT_J(LLₜ_corr, {H_{x̃_{t−1}}^j})。高频子带完全来自引导更新,不会被低频校正覆盖。
整个流程下来,观测的低频结构被牢牢锁住,扩散模型生成的高频细节保留了自己的活力。另外,MWFI只在中间时间窗内激活,太早的极端噪声阶段不适合注入,最后几步则留给模型自由细化细节。
图4:16倍合成超分下MWFI的定性效果
图4:16倍超分下MWFI的定性效果。经过低频相位校正后,面部整体结构和五官位置明显更接近真实值(GT)。

高频增强:真实世界细节的“精修师”

到了真实世界场景,问题又不一样了。真实世界里的退化往往是未知的复合退化,低频结构已经由MWFI校正,但高频细节可能恢复得不够充分——扩散模型生成的结果虽然整体不错,但眉毛、头发丝、皮肤纹理这些细节还是有点“肉”。
SHE(Subband High-Frequency Enhancement,子带高频增强)就是为此设计的。它不动低频子带(低频交给MWFI),只对高频子带做受控增强。具体来说,先对预测的干净图像做J级小波分解:
公式:小波分解
(LL_{x̂₀|ₜ}, H_{x̂₀|ₜ}) = DWT_J(x̂₀|ₜ)。H包含不同尺度、不同方向的高频子带。
然后对每一级高频子带做有界裁剪,避免放大不稳定的伪影:
公式:有界裁剪
H̄ⱼ = clip(Hⱼ, −k, k)。k是固定的裁剪阈值,防止异常的高频响应被放大。
再做一个受控增益放大:
公式:受控高频增强
H̃ⱼ = Hⱼ + γₜ Mⱼ ⊙ H̄ⱼ。γₜ是增益系数,在激活窗口内线性衰减;Mⱼ是第j级的空间掩码,采用椭圆形掩码,中央人脸区域权重最大,向边界迅速衰减,这样就不会放大背景里的噪声。
最终通过逆小波变换重构出精修后的估计:
公式:精修重构
x̂₀|ₜ* = IDWT_J(LL_{x̂₀|ₜ}, {H̃ⱼ})。这个精修后的图像用于计算后验均值,从而影响下一步的采样方向。
真实世界里还有一个问题:不同输入的退化程度差异很大,统一用一套采样参数肯定不合适。于是论文设计了一个零参数的频率比路由器:先对输入做一个轻量高斯预滤波,计算第1级和第3级小波分解的高频系数平均绝对幅度E₁和E₃,然后算比值:
公式:频率比路由
r_y = E₁/(E₃+ε)。r_y小于阈值τ_r的输入认为退化更严重,使用更强的采样配置(对应16倍设置);否则使用更温和的配置(对应8倍设置)。整个路由器没有任何可训练组件,完全依靠输入自身的频率分布特征做自适应选择。
图6:自适应配置选择的视觉比较
图6:自适应策略选择的配置在视觉质量上持续优于其他备选配置。每张图像上的标签表示所选用的预定义尺度配置。

实验结果:全面领先的修复效果

实验设置方面,论文使用在FFHQ上预训练的无条件扩散模型作为冻结先验,合成超分在CelebA-HQ测试集的1000张固定子集上进行4倍、8倍、16倍评估;真实世界场景则使用CodeFormer提供的LFW-Test、WIDER-Test、WebPhoto-Test三个测试集。对比方法包括CodeFormer、DPS、DiffBIR、OSDFace、FiDeSR和SubDAPS++。
先看合成超分结果。表1给出了CelebA-HQ上的定量对比:
表1:CelebA-HQ测试集上的合成人脸超分定量比较
表1:CelebA-HQ测试集上的合成人脸超分辨率定量比较。最优和第二优的结果分别用粗体和下划线标出。ID表示身份相似度,LMD表示关键点距离。
从表格可以看到,在4倍超分上,本文方法在SSIM、LPIPS、ID、LMD四个指标上排名第一,PSNR上排名第二(30.00 dB vs SubDAPS++的30.71 dB)。在8倍和16倍更严苛的设置下,方法在LPIPS、ID、LMD上持续拿到最优,说明它在感知质量和身份保持上的优势会随着退化加剧而更加明显。尤其注意16倍下的ID值:本文达到0.553,而SubDAPS++只有0.513,CodeFormer只有0.444。身份相似度上的优势相当显著。
图2:合成人脸超分定性比较
图2:8倍和16倍双三次下采样下合成人脸超分的定性比较。
定性结果上,16倍下采样时其他方法的人脸已经开始“变形”,本文方法还原出的五官结构最接近真实值(GT)。8倍时,本文方法还原的细节更锐利、轮廓更清晰。
真实世界场景的定量结果见表2:
表2:真实世界人脸修复定量比较
表2:真实世界人脸修复的定量比较。最优和第二优结果分别用粗体和下划线标出。C-IQA表示CLIPIQA指标。
这一次可以说是全面领先——在LFW-Test、WIDER-Test、WebPhoto-Test三个真实测试集上,本文方法在NIQE、PI、MUSIQ、CLIPIQA、TOPIQ五个指标上全部拿到第一。特别是在WIDER-Test这种带较大姿态和表情变化的数据集上,PI从SubDAPS++的9.17直接降到2.79,提升幅度相当大。
图3:真实世界人脸修复定性比较
图3:LFW-Test、WIDER-Test和WebPhoto-Test上的真实世界人脸修复定性比较。
定性上看,真实场景里CodeFormer和DiffBIR的恢复结果容易出现不自然的“塑料感”,DPS和SubDAPS++在这类未知退化上几乎失效,而本文方法不仅能恢复出清晰的五官,而且面部比例更贴近输入观测中的真实结构。
组件消融实验同样做得很扎实。表3展示了16倍合成超分下的组件贡献:
表3:16倍合成超分上的组件消融以及与观测引导扩散方法的比较
表3:16倍合成超分上的组件消融以及与观测引导扩散方法的比较。
可以看到,单独的像素锚定在ID上就达到了0.5531,已经超过DPS的0.4725和SubDAPS++的0.5207;加入锚定空间波结构引导后ID提升到0.5735,LMD也明显降低;再加上MWFI后ID进一步提升到0.5852,LMD降到3.0472。三个组件对最终效果的贡献是清晰可叠加的。
论文还额外分析了ϕ(·)中不同初始速度和传播方式的影响:
表4:16倍合成超分上ϕ(·)的消融实验
表4:16倍人脸超分上ϕ(·)的消融实验。像素锚定被保留,MWFI被禁用。
去掉拉普拉斯初始化(v₀=0)时ID提升到0.5789但LMD变差到3.1268;改成各向同性传播时LMD略好但ID掉到0.5706。说明拉普拉斯初始化的各向异性传播在身份相似度和关键点一致性之间取得了更好的平衡。
表5对MWFI的低频相位校正做了量化分析:
表5:16倍合成超分下MWFI的低频相位校正分析
表5:16倍合成超分下MWFI的低频相位校正分析。将校正前后的仅低频重建结果分别与真实值进行比较。
仅用低频子带重建时,相位校正能把PSNR从25.03 dB提升到25.84 dB,LPIPS从0.1555降到0.1480,直接证明替换相位确实让低频结构更贴近观测。
最后表6验证了SHE在真实世界场景中的作用:
表6:SHE在真实世界测试集上的消融实验
表6:SHE在真实世界测试集上的消融实验。
去掉SHE后,NIQE从4.535恶化到5.899,PI从3.028恶化到5.248,MUSIQ从71.72大幅下滑到63.76。SHE对真实世界图像的感知质量起着决定性作用。
图5:真实世界修复下SHE的定性效果
图5:真实世界修复下SHE的定性效果。
从整体结果来看,WaveFreqAnchor的设计逻辑非常自洽:合成场景有明确的下采样算子,依靠ASWG+MWFI就能获得很好的效果;真实场景退化未知,额外加一层SHE做高频补强,配合频率比路由器自适应选择合适的采样配置。从测试集指标来看,这套组合拳是有效的。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文提出WaveFreqAnchor,一种无需训练的扩散人脸修复框架,通过波结构锚定引导(ASWG)、多尺度小波-傅里叶注入(MWFI)与子带高频增强(SHE)约束扩散采样轨迹。
这篇工作最值得看的点是什么?在合成超分任务中,4×下SSIM/LPIPS/ID/LMD最优,PSNR第二;8×和16×下LPIPS/ID/LMD最优。真实世界修复中,在LFW-Test、WIDER-Test和WebPhoto-Test上所有指标均取得最优结果。
这篇工作的边界或风险在哪里?优点:无需训练即可实现高质量人脸修复,有效保持身份一致性;波结构引导和频率校正在理论上具有创新性;在严重退化条件下表现优异。缺点:依赖预训练扩散模型的质量;频率比路由器仅有两个预设配置,无法覆盖连续的真实退化范围;对严重色偏、过曝和低对比度场景仍存在挑战。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种无需训练的扩散采样框架,通过锚定空间中的波结构引导和频域小波-傅里叶注入来约束反向扩散过程,在保持身份一致性的同时恢复高频细节。

实验合理度:★★★★☆

PSNR、SSIM、LPIPS、ID余弦相似度、LMD地标距离(合成);NIQE、PI、MUSIQ、CLIPIQA、TOPIQ(真实)

学术研究价值:★★★★☆

提出一种无需训练的扩散采样框架,通过锚定空间中的波结构引导和频域小波-傅里叶注入来约束反向扩散过程,在保持身份一致性的同时恢复高频细节;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

在NVIDIA RTX 5060 Ti (16GB)上运行,1000步扩散过程,具体FLOPs未报告。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:依赖预训练扩散模型的质量;频率比路由器仅有两个预设配置,无法覆盖连续的真实退化范围;对严重色偏、过曝和低对比度场景仍存在挑战。

主要参考文献

[1] Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models[C]. NeurIPS, 2020.
[2] Chung H, Kim J, Mccann M T, et al. Diffusion posterior sampling for general noisy inverse problems[C]. ICLR, 2023.
[3] Zhou S, Chan K C K, Li C, et al. Towards robust blind face restoration with codebook lookup transformer[C]. NeurIPS, 2022.
[4] Lin X, He J, Chen Z, et al. DiffBIR: Towards blind image restoration with generative diffusion prior[J]. arXiv preprint arXiv:2308.15070, 2023.
[5] Wang Y, Yu Y, Yang W, et al. OSDFace: One-step diffusion for face restoration[J]. arXiv preprint, 2025.
[6] Mallat S G. A theory for multiresolution signal decomposition: The wavelet representation[J]. IEEE TPAMI, 1989, 11(7): 674-693.
[7] Oppenheim A V, Lim J S. The importance of phase in signals[J]. Proceedings of the IEEE, 1981, 69(5): 529-541.
[8] Karras T, Laine S, Aila T. A style-based generator architecture for generative adversarial networks[C]. CVPR, 2019.
[9] Zheng H, Li W, Liu J. SubDAPS++: Dynamic-resolution diffusion priors for inverse problems[J]. arXiv preprint, 2026.
[10] Kim S, Lee J, Park H, et al. FiDeSR: Frequency-adaptive diffusion enhancement for super-resolution[J]. arXiv preprint, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       


转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球