公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~

龙哥推荐理由:
继2026年6月聊过自蒸馏扩散语言模型后,伯克利等机构再放大招!本文精准诊断出扩散模型RL后训练的“双重漂移”顽疾,并提出DiPOD框架巧妙根治。不仅理论扎实,在数独任务上首次实现零样本饱和,机器人控制训练也更稳了。
原论文信息如下:
1. 扩散模型RL后训练为何不稳定?揭秘“双重漂移”罪魁祸首
FPO(McAllister et al., 2025)直接使用ELBO的梯度来近似策略梯度。但ELBO的变化≠log-likelihood的变化:ELBO可能升高而log-likelihood反而下降(如果变分差距缩小得更多)。这在负优势样本上尤其危险:模型可以通过“作弊”——增大变分差距(破坏扩散模型结构)来降低ELBO,从而看似惩罚了坏动作,实际却破坏了模型的生成质量。
SPG(Wang et al., 2025)聪明地结合了ELBO和EUBO:对正优势样本用ELBO,对负优势样本用EUBO,保证目标函数是真实目标的上下界组合。虽然从目标函数角度看更安全,但梯度层面仍然不能保证一致性——只要变分差距不为零,代理梯度依然可能偏离真实梯度。
2. 防止漂移!DiPOD框架:在梯度更新中穿插自蒸馏
步骤A(自蒸馏):在参考策略π_ref的rollout数据上最大化ELBO,使得变分差距D^L趋近于0。
步骤B(策略梯度更新):使用一个充分的(adequate)梯度估计器(即当ELBO紧贴时,估计器等于真实梯度估计器)进行策略更新,提升期望回报。
3. 简单实用!一个ELBO正则项即可实现DiPOD核心思想
算法2: DiPOD(实用实现)
输入: 充分梯度估计器g, 扩散策略π_θ, β, 学习率η, batch大小m
输出: 优化后策略π_θ
1. 初始化策略π_θ
2. while 未收敛 do:
3. 采样一批rollout B = {(o^i, a^i)}_{i=1..m}
4. θ ← θ + η·(1/m)∑_{i=1..m}[g_θ(o^i,a^i) + β·∇_θ ELBO_θ(a^i|o^i)]
5. return π_θ4. 效果拔群!扩散语言模型和连续控制任务上的显著提升
5. 理论保证!证明DiPOD能收敛到近似最优解
假设每个自蒸馏步骤都能在参考分布上达到ε-最优的ELBO值。那么选择足够小的学习率η,可以保证每次DiPOD策略更新都能提升期望回报,除非当前策略梯度已经小于O(√ε)。如果过程在某个自蒸馏后停止,则最终策略的梯度范数≤O(√ε),且变分差距≤ε。