← 返回 PaperDaily
大模型与智能体
ICML 2026新作Ribbon:一次训练,搞定不确定性还更准?
Ribbon 这篇挺有意思:它不跟传统贝叶斯正面硬刚,而是把“重采样的不确定性”用影响函数线性化,训练一次就能近似多次重训的效果。更妙的是,狄利克雷浓度参数还能拿来做校准,属于效率和鲁棒性都想要的那类方法。
龙哥读论文
发布于 2026-08-28 00:20:07
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: Ribbon 这篇挺有意思:它不跟传统贝叶斯正面硬刚,而是把“重采样的不确定性”用影响函数线性化,训练一次就能近似多次重训的效果。更妙的是,狄利克雷浓度参数还能拿来做校准,属于效率和鲁棒性都想要的那类方法。
原论文信息如下:
科学算命新神器?Ribbon:一次训练,高效搞定模型不确定性
模型会“猜答案”不稀奇,稀奇的是它还得告诉你:我到底有多确定 。这事在医学、气候、自动驾驶这类场景里尤其要命,因为“答对了但很自信”不一定危险,“答错了还很自信”才是真正的事故制造机。
Ribbon 这篇论文干的事,说白了就是把“重训很多次才能得到的不确定性 ”压缩成“一次训练 + 若干线性代数”。它不是去硬碰硬做完整贝叶斯推断,也不是傻乎乎反复重跑模型,而是把自助法里的数据重加权过程,用影响函数做了一次局部线性化近似。听起来像算命,实际上更像给模型做体检:不用反复开刀,先看局部反应。
这篇方法最有意思的地方在于,它把两类传统路线揉到了一起:贝叶斯路线擅长给出概率解释,但算起来贵;自助法路线更鲁棒,但每次都要重训,钱包和显卡都先哭一遍。Ribbon 的思路是:既然重训的核心是“数据被重新加权后,参数会怎么动”,那就别真的重训了,直接在当前最优点附近做一阶近似,把参数扰动推出来。
先把背景捋顺一点。自助法(bootstrap) 就是对训练集反复抽样或重加权,看模型在这些扰动下会怎么变。贝叶斯自助法(Bayesian bootstrap) 则是把样本权重从狄利克雷分布里抽出来,再重新拟合模型。这里的狄利克雷分布,英文全称是 Dirichlet distribution ,中文叫狄利克雷分布 ,它的作用很像“给每个样本随机分配发言权”。
Ribbon 的关键不是“抽权重”这一步,而是“如何把重加权后的重训结果快速近似出来 ”。它先训练一个基础模型,得到参数 θ̂ ,然后把每个样本的梯度、曲率都在这个点上算出来,再用影响函数把“权重变化”转换成“参数变化”。这样一来,原本要重复训练很多次的操作,变成了若干次矩阵-向量运算。对深度学习来说,这就像把“重装整台机器”改成“换几个关键零件”,思路一下就轻快了。
为了把这件事讲清楚,论文还引入了两个很关键的量。H 是平均曲率,反映损失函数在当前最优点附近“弯得有多厉害”;HF 是梯度二阶矩,反映每个样本的梯度波动有多大。直白点说,H 管“地形有多陡”,HF 管“样本之间闹腾得有多厉害”。
当模型在训练点附近做一阶展开后,参数扰动就能写成“影响函数”的线性组合。影响函数的英文是 Influence Function ,中文叫影响函数 。它的直觉很朴素:如果把某个样本稍微抬高一点权重,最优参数会往哪个方向挪、挪多少。
Ribbon 的流程可以理解成“三步走”。第一步先把基础模型训练好;第二步在这个模型附近估计曲率和梯度统计量;第三步不断抽狄利克雷权重,借由影响函数生成参数扰动,再把扰动推到预测空间里。整个过程像是“先搭好底盘,再做弹簧测试”,而不是每次都把车拆了重新装。
如果训练里带固定正则项,Ribbon 也没有装死,而是把正则的 Hessian 一并纳入。论文还特别提醒:如果优化没有完全收敛,或者存在数值误差,梯度二阶矩最好用中心化版本 HF,c ,否则不确定性会被“脏梯度”带偏。
Ribbon 不是只会“近似”,它还给了一个很实用的旋钮:狄利克雷浓度参数 α 。α 小,权重分布更散,参数扰动更大;α 大,权重更接近均匀,模型更稳。这个旋钮的价值在于,它允许把不确定性的整体尺度拿到验证集上做校准,而不是拍脑袋定死。
论文还给出了一个很实用的解释:在正确建模时,Ribbon 会和经典的平坦先验 Laplace 近似对齐;在模型失配时,它又会自然退化成稳健的 sandwich 协方差。这里的 sandwich covariance 中文叫夹心协方差 或稳健协方差 ,意思是“上面一层曲率,下面一层梯度波动,中间夹着参数逆矩阵”。
对分类任务,Ribbon 不是直接在 softmax 后面瞎抖,而是先在 logits 上做线性化,再过 softmax。这个顺序很重要,因为概率空间是弯的,先在线性空间里处理更稳,别一上来就把曲线空间当直线走。
不偏不倚的评估:Ribbon在回归与分类任务上的表现
论文的实验并不花里胡哨,主要围绕三类场景展开:异方差正弦回归、California Housing 回归,以及 MNIST-10 分类。这个选择是合理的,因为它们分别对应了“分布外不确定性”“真实回归任务”和“分类校准”三种常见痛点。
这组结果最有说服力的地方在于,它把“不确定性是否靠谱”可视化了。很多方法在 ID 区域看起来都挺正常,一到 OOD 区域就开始瞎自信;Ribbon 至少在这个基准上,区间扩张是符合直觉的。
在这个任务上,Ribbon 的优势更偏向“稳”和“快”。它没有强行追求极限精度,但在覆盖率和分布质量上表现比较均衡,尤其是和需要重训的 bootstrap 基线相比,后处理时间优势很明显。
分类实验里,Ribbon 的表现说明它不只是回归里能“讲道理”,在概率输出更敏感的分类任务上也能保持较好的校准。尤其当与结构化曲率近似结合时,它能把“后验采样太贵”的问题压下去,同时保留较合理的预测分布。
Ribbon 的优点很鲜明,但它也不是“装上就灵”。它的核心近似依赖局部线性化,所以如果模型非常非线性、优化点离真实最优很远,或者权重扰动太猛,近似误差就会变大。说白了,它擅长的是“在当前山头附近看风景”,不是“把整片大陆重新测绘”。
另外,Ribbon 需要曲率信息,哪怕论文已经给出了很多高效近似,比如 GGN、KFAC、低秩或对角近似,这些东西在超大模型上仍然不是“白送”的。也就是说,它虽然比重训省,但并不是零成本。省的是重复训练,不是数学 。
未来如果要继续往前走,比较自然的方向有两个:一是把 Ribbon 和更强的曲率近似、分层参数化或者稀疏结构结合起来,继续压低成本;二是把它用于更复杂的任务,比如大模型微调、结构化预测或带分布漂移的工业场景。只要能把“校准”和“效率”同时守住,它就很有机会从论文里的漂亮工具,变成工程里的常用件。
龙迷三问
这篇论文到底解决什么问题? 它解决的是“模型不确定性怎么高效估计”这个老大难。传统贝叶斯和 bootstrap 都靠谱,但太贵;Ribbon 的思路是用一次训练加影响函数线性化,近似出重加权重训带来的不确定性。
α 到底起什么作用? α 是狄利克雷分布的浓度参数,决定权重扰动有多大。α 小,不确定性更“放飞”;α 大,权重更集中,预测更保守。论文里还把它当成可校准的旋钮,用验证集来选更合适的尺度。
Ribbon 和 Laplace、bootstrap 的关系是什么? 在正确建模时,Ribbon 和平坦先验 Laplace 近似是一致的;在模型失配时,它又会回到更稳健的 sandwich 协方差。和 bootstrap 相比,它保留了重加权的精神,但不用每次重训,效率高很多。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把 Dirichlet 重加权、自助法和影响函数线性化统一起来,思路很顺,属于“不是发明了新宇宙,但把几条老路接成了高架桥”。
实验合理度: ★★★★☆。任务选择覆盖了回归、分类和分布外场景,指标也比较对口;如果再多一些大模型或更复杂任务,会更有说服力。
学术研究价值: ★★★★☆。它对不确定性量化这条线很有启发,尤其是在“鲁棒性 vs 计算成本”这个经典矛盾上给了可落地的折中方案。
稳定性: ★★★☆☆。局部线性化是好东西,但前提是别离最优点太远、别太非线性;工程上能用,但不是闭眼乱用。
适应性以及泛化能力: ★★★☆☆。对一般可微模型比较友好,但对极端分布漂移、强非线性或难估曲率模型,泛化还要看具体实现。
硬件需求及成本: ★★★★☆。比重训式 bootstrap 省得多,主要花在线性代数和曲率近似上;相比多次重训,已经算是很会过日子了。
复现难度: ★★★☆☆。方法本身清楚,但曲率近似、校准策略和实现细节会影响结果,复现时还是得仔细对齐。
产品化成熟度: ★★★☆☆。在中小模型和可微任务上有实用潜力,适合做“可信输出层”;但要上生产,还得验证稳定性、延迟和漂移下的表现。
可能的问题: 局部近似依赖较强,曲率估计和 α 校准若处理不好,容易出现“看起来很稳,实际上偏了”的情况。
主要参考文献
Gibson, G., Tipton, J., Rumsey, K., & Klein, N. Ribbon: Scalable Approximation and Robust Uncertainty Quantification. arXiv preprint, 2026.
Efron, B. Bootstrap methods: Another look at the jackknife. 1979.
Rubin, D. B. The Bayesian bootstrap. 1981.
White, H. A heteroskedasticity-consistent covariance matrix estimator and a direct test for heteroskedasticity. 1980.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
读 Ribbon 这种“训练一次、后处理搞定不确定性”的论文,最适合来群里边聊边拆,少走弯路,多看门道。