实验设置方面,论文使用在FFHQ上预训练的无条件扩散模型作为冻结先验,合成超分在CelebA-HQ测试集的1000张固定子集上进行4倍、8倍、16倍评估;真实世界场景则使用CodeFormer提供的LFW-Test、WIDER-Test、WebPhoto-Test三个测试集。对比方法包括CodeFormer、DPS、DiffBIR、OSDFace、FiDeSR和SubDAPS++。先看合成超分结果。表1给出了CelebA-HQ上的定量对比:表1:CelebA-HQ测试集上的合成人脸超分辨率定量比较。最优和第二优的结果分别用粗体和下划线标出。ID表示身份相似度,LMD表示关键点距离。从表格可以看到,在4倍超分上,本文方法在SSIM、LPIPS、ID、LMD四个指标上排名第一,PSNR上排名第二(30.00 dB vs SubDAPS++的30.71 dB)。在8倍和16倍更严苛的设置下,方法在LPIPS、ID、LMD上持续拿到最优,说明它在感知质量和身份保持上的优势会随着退化加剧而更加明显。尤其注意16倍下的ID值:本文达到0.553,而SubDAPS++只有0.513,CodeFormer只有0.444。身份相似度上的优势相当显著。图2:8倍和16倍双三次下采样下合成人脸超分的定性比较。定性结果上,16倍下采样时其他方法的人脸已经开始“变形”,本文方法还原出的五官结构最接近真实值(GT)。8倍时,本文方法还原的细节更锐利、轮廓更清晰。真实世界场景的定量结果见表2:表2:真实世界人脸修复的定量比较。最优和第二优结果分别用粗体和下划线标出。C-IQA表示CLIPIQA指标。这一次可以说是全面领先——在LFW-Test、WIDER-Test、WebPhoto-Test三个真实测试集上,本文方法在NIQE、PI、MUSIQ、CLIPIQA、TOPIQ五个指标上全部拿到第一。特别是在WIDER-Test这种带较大姿态和表情变化的数据集上,PI从SubDAPS++的9.17直接降到2.79,提升幅度相当大。图3:LFW-Test、WIDER-Test和WebPhoto-Test上的真实世界人脸修复定性比较。定性上看,真实场景里CodeFormer和DiffBIR的恢复结果容易出现不自然的“塑料感”,DPS和SubDAPS++在这类未知退化上几乎失效,而本文方法不仅能恢复出清晰的五官,而且面部比例更贴近输入观测中的真实结构。组件消融实验同样做得很扎实。表3展示了16倍合成超分下的组件贡献:表3:16倍合成超分上的组件消融以及与观测引导扩散方法的比较。可以看到,单独的像素锚定在ID上就达到了0.5531,已经超过DPS的0.4725和SubDAPS++的0.5207;加入锚定空间波结构引导后ID提升到0.5735,LMD也明显降低;再加上MWFI后ID进一步提升到0.5852,LMD降到3.0472。三个组件对最终效果的贡献是清晰可叠加的。论文还额外分析了ϕ(·)中不同初始速度和传播方式的影响:表4:16倍人脸超分上ϕ(·)的消融实验。像素锚定被保留,MWFI被禁用。去掉拉普拉斯初始化(v₀=0)时ID提升到0.5789但LMD变差到3.1268;改成各向同性传播时LMD略好但ID掉到0.5706。说明拉普拉斯初始化的各向异性传播在身份相似度和关键点一致性之间取得了更好的平衡。表5对MWFI的低频相位校正做了量化分析:表5:16倍合成超分下MWFI的低频相位校正分析。将校正前后的仅低频重建结果分别与真实值进行比较。仅用低频子带重建时,相位校正能把PSNR从25.03 dB提升到25.84 dB,LPIPS从0.1555降到0.1480,直接证明替换相位确实让低频结构更贴近观测。最后表6验证了SHE在真实世界场景中的作用:表6:SHE在真实世界测试集上的消融实验。去掉SHE后,NIQE从4.535恶化到5.899,PI从3.028恶化到5.248,MUSIQ从71.72大幅下滑到63.76。SHE对真实世界图像的感知质量起着决定性作用。图5:真实世界修复下SHE的定性效果。从整体结果来看,WaveFreqAnchor的设计逻辑非常自洽:合成场景有明确的下采样算子,依靠ASWG+MWFI就能获得很好的效果;真实场景退化未知,额外加一层SHE做高频补强,配合频率比路由器自适应选择合适的采样配置。从测试集指标来看,这套组合拳是有效的。
[1] Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models[C]. NeurIPS, 2020.[2] Chung H, Kim J, Mccann M T, et al. Diffusion posterior sampling for general noisy inverse problems[C]. ICLR, 2023.[3] Zhou S, Chan K C K, Li C, et al. Towards robust blind face restoration with codebook lookup transformer[C]. NeurIPS, 2022.[4] Lin X, He J, Chen Z, et al. DiffBIR: Towards blind image restoration with generative diffusion prior[J]. arXiv preprint arXiv:2308.15070, 2023.[5] Wang Y, Yu Y, Yang W, et al. OSDFace: One-step diffusion for face restoration[J]. arXiv preprint, 2025.[6] Mallat S G. A theory for multiresolution signal decomposition: The wavelet representation[J]. IEEE TPAMI, 1989, 11(7): 674-693.[7] Oppenheim A V, Lim J S. The importance of phase in signals[J]. Proceedings of the IEEE, 1981, 69(5): 529-541.[8] Karras T, Laine S, Aila T. A style-based generator architecture for generative adversarial networks[C]. CVPR, 2019.[9] Zheng H, Li W, Liu J. SubDAPS++: Dynamic-resolution diffusion priors for inverse problems[J]. arXiv preprint, 2026.[10] Kim S, Lee J, Park H, et al. FiDeSR: Frequency-adaptive diffusion enhancement for super-resolution[J]. arXiv preprint, 2026.