← 返回 PaperDaily 大模型与智能体

ICML 2026新作Ribbon:一次训练,搞定不确定性还更准?

Ribbon 这篇挺有意思:它不跟传统贝叶斯正面硬刚,而是把“重采样的不确定性”用影响函数线性化,训练一次就能近似多次重训的效果。更妙的是,狄利克雷浓度参数还能拿来做校准,属于效率和鲁棒性都想要的那类方法。

ICML 2026新作Ribbon:一次训练,搞定不确定性还更准?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
Ribbon 这篇挺有意思:它不跟传统贝叶斯正面硬刚,而是把“重采样的不确定性”用影响函数线性化,训练一次就能近似多次重训的效果。更妙的是,狄利克雷浓度参数还能拿来做校准,属于效率和鲁棒性都想要的那类方法。


原论文信息如下:
论文标题:
Ribbon: Scalable Approximation and Robust Uncertainty Quantification
发表日期: 2026年06月
发表单位: 没有明确标注
原文链接: https://arxiv.org/pdf/2606.27269v1.pdf

科学算命新神器?Ribbon:一次训练,高效搞定模型不确定性

模型会“猜答案”不稀奇,稀奇的是它还得告诉你:我到底有多确定。这事在医学、气候、自动驾驶这类场景里尤其要命,因为“答对了但很自信”不一定危险,“答错了还很自信”才是真正的事故制造机。
Ribbon 这篇论文干的事,说白了就是把“重训很多次才能得到的不确定性”压缩成“一次训练 + 若干线性代数”。它不是去硬碰硬做完整贝叶斯推断,也不是傻乎乎反复重跑模型,而是把自助法里的数据重加权过程,用影响函数做了一次局部线性化近似。听起来像算命,实际上更像给模型做体检:不用反复开刀,先看局部反应。
Figure 1
图1:异方差正弦函数上的认知不确定性示意。灰色区域是训练分布内,红色区域是分布外。可以看到,Ribbon 关注的不是“预测值像不像”,而是“预测周围到底有多虚”。
这篇方法最有意思的地方在于,它把两类传统路线揉到了一起:贝叶斯路线擅长给出概率解释,但算起来贵;自助法路线更鲁棒,但每次都要重训,钱包和显卡都先哭一遍。Ribbon 的思路是:既然重训的核心是“数据被重新加权后,参数会怎么动”,那就别真的重训了,直接在当前最优点附近做一阶近似,把参数扰动推出来。

从贝叶斯到自助法:Ribbon如何兼顾鲁棒与效率

先把背景捋顺一点。自助法(bootstrap)就是对训练集反复抽样或重加权,看模型在这些扰动下会怎么变。贝叶斯自助法(Bayesian bootstrap)则是把样本权重从狄利克雷分布里抽出来,再重新拟合模型。这里的狄利克雷分布,英文全称是 Dirichlet distribution,中文叫狄利克雷分布,它的作用很像“给每个样本随机分配发言权”。
Ribbon 的关键不是“抽权重”这一步,而是“如何把重加权后的重训结果快速近似出来”。它先训练一个基础模型,得到参数 θ̂,然后把每个样本的梯度、曲率都在这个点上算出来,再用影响函数把“权重变化”转换成“参数变化”。这样一来,原本要重复训练很多次的操作,变成了若干次矩阵-向量运算。对深度学习来说,这就像把“重装整台机器”改成“换几个关键零件”,思路一下就轻快了。
加权经验风险最小化公式
这条式子是 Ribbon 的起点:θ̂w 是在权重 w 下重新拟合得到的参数。ℓ(zi, θ) 是单样本损失,wi 则表示第 i 个样本在这次“重抽样”里有多大话语权。
为了把这件事讲清楚,论文还引入了两个很关键的量。H 是平均曲率,反映损失函数在当前最优点附近“弯得有多厉害”;HF 是梯度二阶矩,反映每个样本的梯度波动有多大。直白点说,H 管“地形有多陡”,HF 管“样本之间闹腾得有多厉害”。
平均曲率公式
H 是所有样本 Hessian 的平均,也就是“局部地形”的总概括。H 越大,说明参数稍微动一下,损失就可能抖得更厉害。
梯度二阶矩公式
HF 则是梯度外积的平均,表示样本扰动在参数空间里会朝哪些方向扩散。Ribbon 后面之所以能同时兼顾“贝叶斯味儿”和“稳健性”,核心就在于这两个量一起上场了。
当模型在训练点附近做一阶展开后,参数扰动就能写成“影响函数”的线性组合。影响函数的英文是 Influence Function,中文叫影响函数。它的直觉很朴素:如果把某个样本稍微抬高一点权重,最优参数会往哪个方向挪、挪多少。
单样本影响函数
这条式子看着像数学界的“推拿手法”,其实意思很简单:样本 i 对参数的局部影响,等于“曲率矩阵的逆”乘上它自己的梯度,再带个负号。负号表示如果这个样本把损失往上拽,参数就会往能压住损失的方向跑。
Ribbon 参数扰动近似
Ribbon 最核心的近似就是这里:Δθw 不再靠重训求出来,而是直接把所有样本的影响函数按“偏离均匀权重的程度”加权求和。换句话说,谁在这轮狄利克雷抽样里被“多分了点权”,谁就在参数扰动里更有存在感。

一张图看懂Ribbon:线性化近似背后的核心机制

Ribbon 的流程可以理解成“三步走”。第一步先把基础模型训练好;第二步在这个模型附近估计曲率和梯度统计量;第三步不断抽狄利克雷权重,借由影响函数生成参数扰动,再把扰动推到预测空间里。整个过程像是“先搭好底盘,再做弹簧测试”,而不是每次都把车拆了重新装。
加权最优性条件
这一步是在说:加权后的最优参数要满足新的梯度为零。Ribbon 就是从这个条件出发,把“重新求解最优点”变成“在旧最优点附近做泰勒展开”。
梯度一阶展开
这就是线性化的“开场白”:新参数附近的梯度,可以近似成旧梯度加上 Hessian 乘以参数位移。因为在基础模型的最优点上,旧梯度本来就接近 0,所以剩下的主角就变成了权重扰动和曲率矩阵。
线性化求解主方程
把上面的式子整理一下,就得到参数变化和权重扰动之间的线性关系。这里的妙处在于:不再需要真正做一次完整训练,只要解一个线性系统就能得到近似结果。对于大模型来说,这可比“再来一遍”友好多了。
如果训练里带固定正则项,Ribbon 也没有装死,而是把正则的 Hessian 一并纳入。论文还特别提醒:如果优化没有完全收敛,或者存在数值误差,梯度二阶矩最好用中心化版本 HF,c,否则不确定性会被“脏梯度”带偏。
中心化梯度二阶矩
这个中心化版本的意思是:把“平均梯度偏移”先减掉,再统计波动。对已经完全收敛的理想情况,它和普通的 HF 没差;但对现实训练过程,这一步很有必要,属于“别让数值小毛病把不确定性搞歪”。

让不确定性“听话”:狄利克雷浓度参数的可调节优势

Ribbon 不是只会“近似”,它还给了一个很实用的旋钮:狄利克雷浓度参数 α。α 小,权重分布更散,参数扰动更大;α 大,权重更接近均匀,模型更稳。这个旋钮的价值在于,它允许把不确定性的整体尺度拿到验证集上做校准,而不是拍脑袋定死。
狄利克雷权重扰动协方差
这里的 w 是从狄利克雷分布里抽出来的随机权重,α 决定这些权重有多“跳”。论文把权重写成 ẇ = n w - j,目的是把它搬到“计数偏差”的尺度上来分析。
参数扰动协方差
这条式子很关键:参数扰动的协方差由三部分拼起来——曲率、梯度波动、以及 α。它说明 Ribbon 的不确定性不是玄学,而是有明确尺度控制的。换句话说,不确定性不是“有或没有”,而是“多大合适”
论文还给出了一个很实用的解释:在正确建模时,Ribbon 会和经典的平坦先验 Laplace 近似对齐;在模型失配时,它又会自然退化成稳健的 sandwich 协方差。这里的 sandwich covariance 中文叫夹心协方差稳健协方差,意思是“上面一层曲率,下面一层梯度波动,中间夹着参数逆矩阵”。
自助法协方差
这就是标准 Bayesian bootstrap 下的参数扰动协方差。它已经很接近“重训很多次”的结果了,但代价是每次都得重新拟合。
Laplace 协方差
而这个式子则是经典 Laplace 近似最熟悉的样子:协方差大致等于 Hessian 的逆再除以样本量。Ribbon 的厉害之处不在于“另起炉灶”,而在于把这条路线和自助法统一起来了。
算法流程图
图2:Ribbon 的整体算法流程。先训练基础模型,再构造曲率算子,随后从狄利克雷分布抽权重,最后用影响函数和 Jacobian 把参数扰动推到预测空间。
对分类任务,Ribbon 不是直接在 softmax 后面瞎抖,而是先在 logits 上做线性化,再过 softmax。这个顺序很重要,因为概率空间是弯的,先在线性空间里处理更稳,别一上来就把曲线空间当直线走。
分类任务中的预测传播
这里的 η 是 logits,φ 是 softmax 后的类别概率。Ribbon 先让 logits 走一小步,再把它翻译成概率,这样更容易保持局部近似的合理性。

不偏不倚的评估:Ribbon在回归与分类任务上的表现

论文的实验并不花里胡哨,主要围绕三类场景展开:异方差正弦回归、California Housing 回归,以及 MNIST-10 分类。这个选择是合理的,因为它们分别对应了“分布外不确定性”“真实回归任务”和“分类校准”三种常见痛点。
符号说明表
表1:全文符号说明。论文里用了不少记号,但核心就那几个:H 管曲率,HF 管梯度波动,α 管不确定性尺度,Δθ 管参数扰动。
正弦回归结果表
表2:异方差正弦回归结果。这里最值得看的不是单纯的点预测,而是 90% 认知区间在 ID 和 OOD 区域的覆盖率,以及后处理生成不确定性的时间开销。Ribbon 在不少设置下都能保持不错的覆盖,同时比重训类方法快得多。
正弦回归可视化
图3:正弦回归上的预测均值与 90% 认知区间。可以明显看到,分布外区域的区间会张开,这说明 Ribbon 对“没见过的地方”会更谨慎,不会嘴硬。
这组结果最有说服力的地方在于,它把“不确定性是否靠谱”可视化了。很多方法在 ID 区域看起来都挺正常,一到 OOD 区域就开始瞎自信;Ribbon 至少在这个基准上,区间扩张是符合直觉的。
California Housing结果表
表3:California Housing 回归结果。这里同时看覆盖率、CRPS 和时间开销。CRPS 的全称是 Continuous Ranked Probability Score,中文可译为连续秩概率评分,它衡量的是整个预测分布和真实值的贴合程度,不只是看均值准不准。
在这个任务上,Ribbon 的优势更偏向“稳”和“快”。它没有强行追求极限精度,但在覆盖率和分布质量上表现比较均衡,尤其是和需要重训的 bootstrap 基线相比,后处理时间优势很明显。
MNIST分类结果表
表4:MNIST-10 分类结果。这里重点看准确率、Brier 分数、ECE 和 NLL。ECE 的全称是 Expected Calibration Error,中文叫期望校准误差;Brier 分数则衡量概率预测的整体误差。简单说,前者看“信不信得过”,后者看“概率像不像样”。
分类实验里,Ribbon 的表现说明它不只是回归里能“讲道理”,在概率输出更敏感的分类任务上也能保持较好的校准。尤其当与结构化曲率近似结合时,它能把“后验采样太贵”的问题压下去,同时保留较合理的预测分布。
回归总预测公式
回归里,Ribbon 把参数扰动再加上观测噪声,构成最终预测分布。也就是说,它既考虑“模型自己不确定”,也考虑“数据本身就吵”。
残差方差估计
观测噪声方差用残差来估计,这个做法不花哨,但很实用。毕竟不确定性不是只有“模型猜不准”,还有“世界本来就很吵”这一层。

局限与未来:Ribbon并非万能,下一步向何方

Ribbon 的优点很鲜明,但它也不是“装上就灵”。它的核心近似依赖局部线性化,所以如果模型非常非线性、优化点离真实最优很远,或者权重扰动太猛,近似误差就会变大。说白了,它擅长的是“在当前山头附近看风景”,不是“把整片大陆重新测绘”。
另外,Ribbon 需要曲率信息,哪怕论文已经给出了很多高效近似,比如 GGN、KFAC、低秩或对角近似,这些东西在超大模型上仍然不是“白送”的。也就是说,它虽然比重训省,但并不是零成本。省的是重复训练,不是数学
未来如果要继续往前走,比较自然的方向有两个:一是把 Ribbon 和更强的曲率近似、分层参数化或者稀疏结构结合起来,继续压低成本;二是把它用于更复杂的任务,比如大模型微调、结构化预测或带分布漂移的工业场景。只要能把“校准”和“效率”同时守住,它就很有机会从论文里的漂亮工具,变成工程里的常用件。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是“模型不确定性怎么高效估计”这个老大难。传统贝叶斯和 bootstrap 都靠谱,但太贵;Ribbon 的思路是用一次训练加影响函数线性化,近似出重加权重训带来的不确定性。

α 到底起什么作用?α 是狄利克雷分布的浓度参数,决定权重扰动有多大。α 小,不确定性更“放飞”;α 大,权重更集中,预测更保守。论文里还把它当成可校准的旋钮,用验证集来选更合适的尺度。

Ribbon 和 Laplace、bootstrap 的关系是什么?在正确建模时,Ribbon 和平坦先验 Laplace 近似是一致的;在模型失配时,它又会回到更稳健的 sandwich 协方差。和 bootstrap 相比,它保留了重加权的精神,但不用每次重训,效率高很多。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把 Dirichlet 重加权、自助法和影响函数线性化统一起来,思路很顺,属于“不是发明了新宇宙,但把几条老路接成了高架桥”。

实验合理度:★★★★☆。任务选择覆盖了回归、分类和分布外场景,指标也比较对口;如果再多一些大模型或更复杂任务,会更有说服力。

学术研究价值:★★★★☆。它对不确定性量化这条线很有启发,尤其是在“鲁棒性 vs 计算成本”这个经典矛盾上给了可落地的折中方案。

稳定性:★★★☆☆。局部线性化是好东西,但前提是别离最优点太远、别太非线性;工程上能用,但不是闭眼乱用。

适应性以及泛化能力:★★★☆☆。对一般可微模型比较友好,但对极端分布漂移、强非线性或难估曲率模型,泛化还要看具体实现。

硬件需求及成本:★★★★☆。比重训式 bootstrap 省得多,主要花在线性代数和曲率近似上;相比多次重训,已经算是很会过日子了。

复现难度:★★★☆☆。方法本身清楚,但曲率近似、校准策略和实现细节会影响结果,复现时还是得仔细对齐。

产品化成熟度:★★★☆☆。在中小模型和可微任务上有实用潜力,适合做“可信输出层”;但要上生产,还得验证稳定性、延迟和漂移下的表现。

可能的问题:局部近似依赖较强,曲率估计和 α 校准若处理不好,容易出现“看起来很稳,实际上偏了”的情况。


主要参考文献

Gibson, G., Tipton, J., Rumsey, K., & Klein, N. Ribbon: Scalable Approximation and Robust Uncertainty Quantification. arXiv preprint, 2026.
Efron, B. Bootstrap methods: Another look at the jackknife. 1979.
Rubin, D. B. The Bayesian bootstrap. 1981.
White, H. A heteroskedasticity-consistent covariance matrix estimator and a direct test for heteroskedasticity. 1980.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
读 Ribbon 这种“训练一次、后处理搞定不确定性”的论文,最适合来群里边聊边拆,少走弯路,多看门道。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。