← 返回 PaperDaily 视觉与图像

暴露偏差也能自救?清华华为新方法把Flow Matching拉回正轨

训练看起来很“正经”,推理却偷偷跑偏,这就是 Flow Matching 里最烦人的暴露偏差。DEFAR 的思路很妙:不把偏差当噪声硬压,而是把它当反馈信号,让模型自己学会纠偏。

暴露偏差也能自救?清华华为新方法把Flow Matching拉回正轨
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
训练看起来很“正经”,推理却偷偷跑偏,这就是 Flow Matching 里最烦人的暴露偏差。DEFAR 的思路很妙:不把偏差当噪声硬压,而是把它当反馈信号,让模型自己学会纠偏。


原论文信息如下:
论文标题:
Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching
发表日期:
2026年06月
发表单位:
Tsinghua University; Huawei Central Media Technology Institute
原文链接:
https://arxiv.org/pdf/2606.28226v1.pdf
开源代码链接:
https://github.com/wuliwuliy/DEFAR
项目链接:
https://github.com/wuliwuliy/DEFAR/raw/main/assets/defar_overview.png

训练推理不一样,生成模型遭遇“暴露偏差”危机

生成模型里最烦人的事,不一定是模型不够大,而是训练时看起来很稳,推理时却一路跑偏。这篇论文盯上的,就是 Flow Matching 里的这个老问题:暴露偏差
先把话说人话。Flow Matching 可以理解成“教模型沿着一条连续轨迹,把噪声一步步推回真实图像”。训练时,模型通常看到的是理想路径上的中间状态;但真到推理时,模型每一步都要吃自己上一轮的输出。只要前面某一步歪了,后面就会像多米诺骨牌一样继续歪,这就是暴露偏差。
图1:Flow Matching中的暴露偏差示意图
图1:Flow Matching 中的暴露偏差示意图。训练阶段沿理想线性路径学习,推理阶段则会因为前序误差累积而偏离训练分布。
以前很多方法的思路,基本是“把偏差按住别乱跑”。要么在训练里硬塞扰动,要么在推理时加一些外部修正。问题是,这些做法大多是静态对齐:不管偏差大不大,修正方向都差不多,像拿同一把扳手修所有螺丝,能拧上,但不够聪明。
这篇论文的思路更狠一点:既然暴露偏差本身就是推理误差的“现场记录”,那它就不该只被当成噪声,而应该被当成反馈信号。于是,DEFAR 诞生了。

化敌为友,暴露偏差信号竟能自我修正

DEFAR 的全名是 DirEctional-Frequency Adaptive Rectification,中文可以理解成“方向与频率自适应校正”。名字听起来像术语堆叠,实际干的事很直接:让模型在训练时模拟推理失误,再把失误本身变成纠偏信号
这件事为什么重要?因为暴露偏差不是随机坏掉,它带着信息。模型在推理时偏离目标,不只是“错了”,还说明该往哪个方向拉回来、哪里缺了结构信息。论文抓住的正是这两类信息:方向信息和频率信息。
为了更接近真实推理,论文在训练阶段加入了单步推理模拟。也就是先让模型走一步,看看它会不会歪,再基于这个“歪掉的状态”继续构造训练信号。这样一来,训练不再只盯着理想路径,而是开始面对“推理时真实会遇到的偏差”。
图2:DEFAR方法总览图
图2:DEFAR 方法总览图。ADR 负责“把偏航方向拉回来”,FC 负责“把缺失的频率补上来”,两者共同构成 DEFAR 的自校正框架。
这里先解释一个常见背景概念。Flow Matching 的核心,是学习一个随时间变化的速度场,让样本从噪声平滑流向真实数据。与扩散模型相比,它训练和采样的形式更直接,理论上也更简洁。但问题也很现实:越是依赖逐步生成,越怕前面的误差被后面放大

方向+频率双管齐下,DEFAR框架精准修正

DEFAR 不是一个单点技巧,而是两个互补模块的组合:ADR(Anti-Drift Rectification,抗漂移校正)FC(Frequency Compensation,频率补偿)。一个管方向,一个管结构,思路很像修车:先把车头掰正,再把轮胎气压补足,不然光靠一头猛拧,车还是会抖。
图3:频率分析与频率补偿动机验证
图3:频率分析与频率补偿动机验证。图中展示了前向扰动与单步推理下的频率趋势差异,也说明了暴露偏差在高噪声阶段会突出低频语义,正好能拿来做补偿信号。
先看 ADR。论文的关键想法是:既然推理时的输入已经歪了,那训练时就应该显式告诉模型“从这个歪掉的位置,应该往哪里回”。所以 ADR 构造了一个从偏移状态回到目标分布的方向目标,把“纠偏方向”直接变成学习目标之一。
这比单纯让模型模仿静态真值更聪明。因为同一个真值,在不同偏差程度下,模型需要的“回正力度”并不一样。ADR 的设计让纠偏强度随着偏差程度动态变化,偏得越厉害,纠得越明显,避免了“无论轻微跑偏还是严重跑偏,都用同一剂药”的尴尬。
再看 FC。论文做了频率分析后发现,高噪声阶段的预测常常缺低频结构信息,比如大轮廓、主体布局、背景结构这些最“骨架级”的内容。更有意思的是,暴露偏差在这些阶段反而会把这些缺失的低频区域凸显出来。换句话说,偏差像是在偷偷提醒模型:这里还没画稳,先补这里
于是 FC 干脆把暴露偏差当作一个动态重加权信号。它不是额外加一个外部先验,而是让偏差自己决定该重点学哪些频段。高噪声阶段,模型更缺结构;偏差又正好指向结构缺口;那就把损失权重往这些区域上倾斜一点。这个思路很像“哪里薄弱就重点补课”,而不是全班统一刷题。
图9:暴露偏差突出低频结构的可视化
图9:暴露偏差突出低频结构的可视化。可以看到,偏差往往和图像中的低通区域对齐,这正是 FC 能成立的关键证据。
为了把这套逻辑讲严谨,论文还定义了两个频率指标。PFR(Predicted Frequency Ratio,预测频率比) 用来衡量预测结果里低频和高频能量的比例;FEL(Frequency Emphasis of Loss,损失频率强调度) 用来衡量损失更偏向低频还是高频。两者一起用,才能判断模型到底是在补结构,还是只是在表面上抹平噪点。
这里有个很关键的工程判断:FC 不是单纯把损失“加权更大”,而是把权重放到更需要学习的频段上。这类方法如果做对了,通常比盲目加大训练强度更有效,因为它减少的是“无效学习”。
图6:ImageNet-256上的定性对比
图6:ImageNet-256 上的定性对比。相同 50 步采样下,DEFAR 的语义结构更稳,视觉伪影也更少。

实验效果惊人,FID全面超越现有方法

实验部分最值得看的,不是某一个“最优数字”,而是它证明了 DEFAR 的三个现实价值:能涨点、能省算力、还能和别的方法兼容。这三件事能同时成立,才算真有落地味道。
表1:条件生成任务上的定量比较
表1:条件生成任务上的定量比较。DEFAR 在 ImageNet-256 和 CIFAR-10 上都优于多个基线,并且在相近训练成本下表现更稳。
先看主表。DEFAR 在 ImageNet-256 和 CIFAR-10 的条件生成上,都把 FID 往下压了,而且不是靠无限加训练预算硬堆出来的。更重要的是,它在 50 步采样这个相对常见的设置下就能体现优势,说明它改善的是模型对推理误差的基本耐受性,不是只在某个特殊采样配置里“碰巧好看”。
从结果形态看,ADR 和 FC 都不是可有可无。去掉 FC,说明频率补偿确实在帮模型补结构;去掉 ADR,说明方向校正也不是摆设。两者合起来,才能把“偏差驱动纠偏”这件事做完整。换句话说,这不是一个模块单打独斗的故事,而是方向与频率互补的故事。
表2:无条件生成与互补缓解策略比较
表2:无条件生成与互补缓解策略比较。DEFAR 在 CIFAR-10 和 CelebA-64 上同样有效,并且还能和外部引导、OT 采样等策略形成互补。
无条件生成的结果更说明问题:DEFAR 不只是在带类别条件的数据上有效,在 CelebA-64 这类更偏结构细节的人脸生成任务上也能继续稳住。右侧的互补实验则说明,它和外部判别器引导、mini-batch OT coupling 这些方法并不冲突,反而能作为底层训练修正一起工作。这意味着 DEFAR 不是“替代一切”的大话,而是一个可插拔的训练侧增强模块
表3:DEFAR在不同模型规模上的可扩展性
表3:DEFAR 在不同模型规模上的可扩展性。随着主干变强,DEFAR 仍能稳定带来收益,说明它不是“只对小模型灵光一现”的技巧。
可扩展性这件事很重要。很多论文在小骨干上看着不错,一换大模型就开始失灵。DEFAR 在不同规模上都能保持收益,说明它依赖的不是某个脆弱的局部技巧,而是更普适的训练信号设计。这对工程落地很关键,因为真要进产品,谁也不会愿意为了一个小 trick 重新改整套架构。
表4:架构兼容性与采样鲁棒性
表4:架构兼容性与采样鲁棒性。DEFAR 能接到 REPA、DDT 等更强骨干上,也能在不同采样步数下保持稳定收益。
这张表的含金量在于“兼容性”。如果一个方法只在单一骨干上有效,那更像定制补丁;而 DEFAR 还能接入别的训练框架,说明它的核心逻辑足够通用。采样步数变化下也比较稳,这意味着它对推理预算的依赖没那么苛刻,实用性会更好。
图7:CelebA-64上的定性对比
图7:CelebA-64 上的定性对比。DEFAR 生成的人脸细节更干净,头发结构和面部轮廓也更连贯。
图8:DEFAR-XL/2+在ImageNet-256上的高质量结果
图8:DEFAR-XL/2+ 在 ImageNet-256 上的高质量结果。即便面对结构复杂场景,也能保持较好的细节与反射效果。
从可视化上看,DEFAR 的优势不是“更锐一点点”这种玄学,而是结构更稳、边界更清、伪影更少。这类收益通常比单纯提高某个指标更有说服力,因为它直接反映了生成过程是否真的更可靠。
表10:不同推理步数下的鲁棒性
表10:不同推理步数下的鲁棒性。即使推理步数变化,DEFAR 也能保持相对稳定的优势,说明它对采样设置不算挑食。
这一点很适合实际部署场景。真实系统里,采样步数经常要在质量、延迟、算力之间来回折中。一个方法如果只在固定步数下有效,那部署会很别扭;而 DEFAR 在不同 NFE 下仍然能工作,说明它至少具备进一步工程化的潜力。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是 Flow Matching 在推理时容易“越走越偏”的暴露偏差问题。核心不是再加一个外部修补器,而是让模型学会利用偏差本身提供的方向和频率信息,自我纠偏。

ADR 和 FC 分别在干什么?ADR 是 Anti-Drift Rectification,中文可理解为抗漂移校正,负责学习从偏移状态回到目标分布的方向;FC 是 Frequency Compensation,中文是频率补偿,负责根据偏差信号给缺失的低频结构更多学习权重。

PFR 和 FEL 是什么意思?PFR 是 Predicted Frequency Ratio,指预测结果中低频与高频能量的比例;FEL 是 Frequency Emphasis of Loss,指损失函数对不同频段的关注程度。前者看“模型预测缺什么”,后者看“训练到底在补什么”。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 这篇论文的妙处不在于“又做了一个正则”,而在于把暴露偏差从麻烦变成信号,思路挺顺。

实验合理度:★★★★☆ 条件生成、无条件生成、不同骨干、不同采样步数都做了,覆盖面比较完整,结论也能互相印证。

学术研究价值:★★★★☆ 对 Flow Matching 的训练-推理失配问题给出了可解释的新切口,后续很可能还能迁移到别的生成框架。

稳定性:★★★☆☆ 论文显示了较好的鲁棒性,但这类方法一旦换到更复杂任务,仍需要看频率假设是否继续成立。

适应性以及泛化能力:★★★★☆ 能跨数据集、跨骨干、跨采样设置工作,说明泛化不是纸上谈兵。

硬件需求及成本:★★★☆☆ 训练成本不算低,但它不是靠额外大模型堆出来的,属于“加一点训练逻辑换较稳收益”。

复现难度:★★★☆☆ 代码计划开源,方法本身不算离谱,但频率分析和单步推理模拟都需要实现得比较细。

产品化成熟度:★★★☆☆ 更适合先作为训练增强模块进入实验链路,离稳定的大规模生产还差更多场景验证。

可能的问题:偏差信号是否在所有数据分布上都足够稳定,仍需更多任务验证;此外,频率补偿的收益可能依赖具体生成阶段。


主要参考文献

[1] Guanbo Huang, Jingjia Mao, Fanding Huang, Fengkai Liu, Xiangyang Luo, Yaoyuan Liang, Jiasheng Lu, Xiaoe Wang, Pei Liu, Ruiliu Fu, Ruqi Huang, Shao-Lun Huang. Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching. arXiv:2606.28226v1, 2026.
[2] DEFAR 项目主页与代码:https://github.com/wuliwuliy/DEFAR
[3] 项目演示图:https://github.com/wuliwuliy/DEFAR/raw/main/assets/defar_overview.png

暴露偏差不一定只能挨打,它也可能是模型的“内置提示器”。想看更多这类既能讲清原理、又能落到实验的前沿论文,欢迎加入龙哥读论文粉丝群,一起把复杂方法拆成大白话。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。