← 返回 PaperDaily
大模型与智能体
Ai2最新研究:AI仿真气候400年,速度飙升40倍还精准还原厄尔尼诺
大模型跑天气已不稀奇,但这次Ai2把「大气+海洋」整个地球系统搬进AI,单张GPU比超算快40倍,还稳稳复现了400年的厄尔尼诺变率。AI for Science的又一里程碑,值得所有关注气候与AI交叉的读者花五分钟看看。
龙哥读论文
发布于 2026-08-17 00:20:11
阅读 3
查看原文
原论文信息如下:
先问大家一个问题:想在地球上模拟未来100年的气候变化,需要多大的代价?
传统答案可能超出很多人的想象:一套全球气候模型(GCM)跑起来,动辄需要上千个处理器核心、几周甚至几个月的时间,而且每改一次参数、每多跑一个情景,都得重新烧一遍算力。这也正是为什么国际耦合模式比较计划(CMIP)里,各个建模中心能提供的集合成员数量始终有限。
但AI正在改变这个游戏规则。继AI天气预报在短临预报上大杀四方之后,AI气候仿真器也开始向「全耦合地球系统」这个终极目标发起冲锋。今天要解读的这篇论文,来自艾伦人工智能研究所(Ai2)气候模拟团队,他们把大气、海洋、海冰全部装进了一个基于神经网络的仿真器里,用一张GPU跑出了比传统模型快约40倍的速度,并且用400年的独立数据验证了它的长期稳定性。
这个仿真器叫SamudrACE-E3SMv3,名字有点长,但背后的故事很清晰:它到底是怎么把「大气+海洋」这对互相纠缠的复杂系统塞进神经网络里的?随机性为什么是它保持长期变率的关键?它又在哪里翻了车?这篇文章一次讲清楚。
40倍加速的AI气候仿真器:随机耦合如何突破传统GCM瓶颈
以本文参考的E3SMv3为例,它是美国能源部主导的「能量超算地球系统模型」第三版,代表全球气候模拟的最前沿水平。但跑这样一个模型需要什么条件?论文里写得很直白:在E3SM项目专用集群上,用105个节点(每个节点64个AMD EPYC处理器核心),每天大约只能模拟28年。也就是说,想攒出一个500年的工业化前控制实验,得让几千个核心连续跑上半年。
而SamudrACE-E3SMv3在单张H100 GPU上,推理速度达到每秒1105个模拟年(SYPD)。换算一下,大约是传统模型的40倍。更关键是,它模拟的不是某个单一变量,而是大气+海洋+海冰全套耦合系统。
这个仿真器建立在Ai2此前的SamudrACE框架之上,但做了两个关键升级。第一,把确定性大气仿真器ACE2换成了随机版本ACE2S,并引入概率目标函数做耦合微调;第二,换了一个完全不同的参考模型——从GFDL CM4换成E3SMv3,相当于做了一次跨模型的鲁棒性测试。
为什么要加随机性?这是整篇论文最核心的洞察。传统神经网络做气候仿真,用的是均方误差(MSE)损失,模型学的其实是所有可能天气条件下的「平均答案」。这个平均答案在短时间尺度的预报上够用,但一旦跑上几十年甚至几百年,它就会把气候系统内部真实的波动一点点磨平——就像把海浪照片做了模糊处理,浪还在,但细节全没了。
随机版本的ACE2S通过概率损失函数(CRPS+能量分数)训练,每次预测都输出一组成员的集合,而不是单一确定值。这等于给仿真器装了一个「内部噪声源」,让它生成的天气天然带有真实的波动性。当这个波动通过海表通量传递给海洋,整个耦合系统的内部变率就被保住了。
图1展示了整个训练流程。大气仿真器ACE2S和海洋仿真器Samudra先各自用「完美边界强迫」单独预训练,然后再耦合起来做联合微调。微调阶段两个组件同时优化,目标函数是CRPS和能量分数的加权组合。整个训练过程就像先把两个乐手各自练熟,再合奏时统一校准节拍。
从确定性到随机性:ACE2S如何为气候仿真注入内部变率
先拆解一下SamudrACE-E3SMv3的两个核心组件。
大气组件ACE2S,是Ai2之前发布的ACE2大气仿真器的随机版本。它工作在1度水平分辨率、8个垂直层、6小时时间步长上。ACE2S和ACE2最大的区别在于训练目标:ACE2用确定性损失,ACE2S用的是概率损失——连续排序概率分数(CRPS)加上能量分数。简单理解,CRPS衡量的是「预测的分布」和「真实值」之间的距离,它不要求模型给出唯一答案,而是要求模型给出的概率分布靠谱。
海洋组件Samudra,是纽约大学和Ai2合作开发的全球海洋仿真器,同样1度分辨率、19个垂直层、5天时间步长。它在SamudrACE框架里还额外预测海冰浓度和海冰体积。论文里特意提到,这个版本用了Samudra 2的加宽配置,把四个ConvNeXt模块的通道数增加到了[280, 380, 480, 520],目的是减少深海的「印记」对上层海洋的干扰。
两个组件怎么耦合?大气向海洋传递5天平均的海表通量、降水和风应力;海洋向大气传递海表温度(SST)和海冰覆盖率。每个网格单元内,海洋和陆地占比在两个仿真器之间保持强制一致。
训练分两个阶段。第一阶段是「各自单练」:ACE2S用指定的SST和海冰做强迫,分成两段训练,先单步随机训练30轮,再做多步展开微调30轮;Samudra则用指定的大气强迫做确定性预训练,先在4步(20天)展开上练150轮,再在8步(40天)展开上微调20轮。
第二阶段是「合奏」:两个组件耦合起来,联合微调40轮。每个训练样本展开4个耦合步(20天,对应4个5天海洋步和80个6小时大气步)。关键点来了——每批训练数据里,两个组件的损失计算窗口是独立随机采样的:海洋从{0, 1, 2, 4}步里抽,大气从{0, 1, 2, 4, 21, 41}步里抽。这样做既控制内存占用,又让模型在不同长度的反馈环路上都见过梯度,防止只学会短时间尺度的响应。
耦合微调有个重要细节:ACE2S每次生成两个集合成员,其5天平均海表强迫会驱动两个对应的Samudra展开。两个组件的优化目标都是同一套概率损失(大气和海洋的损失权重相等)。也就是说,随机的种子完全来自大气仿真器,海洋自己并不注入额外噪声。
400年独立检验:平均态、降水与ENSO的保真度评估
论文里最硬核的部分,是评估方案的设计:用E3SMv3的105年工业化前控制模拟做训练,再用另外400年完全独立的数据做评估。这个400年的评估长度,比之前SamudrACE原版论文的200年训练+评估长了一倍还多,能更严格地检验长期保真度——这是气候仿真器能不能用的底线。
先看平均态。论文比较了400年时间平均的表面气温和降水,把仿真器与E3SMv3的偏差,和E3SMv3自身与观测数据的偏差放在一起对比。结果:仿真器的均方根偏差(RMSB)是0.62K(气温)和0.19mm/天(降水),而E3SMv3相对观测的偏差是1.13K和1.04mm/天。换句话说,仿真器「学坏」的程度,远小于参考模型本身「看错」的程度。
不过平均态好,不代表细节没毛病。论文承认了一个老大难区域:巴伦支海和格陵兰海的海冰边缘区(MIZ)。这里海冰覆盖率的微小偏差会被非线性过程放大成局部气温的大偏差。耦合系统里,海冰边缘的误差会反馈到海表通量,进一步推开冰缘,形成「错误放大闭环」。这也直接导致耦合后的北欧海SST均方根偏差从非耦合的0.15K涨到了2.1K。
降水方面,论文用泰勒图把大气和海洋所有变量的400年平均态压缩到一张图里。几乎所有变量都挤在零偏差点(1,0)附近,唯一的例外是平流层比总水(q0)——因为它的时间平均场接近均匀,归一化后的小误差被放大了,属于物理上可忽略的「虚惊一场」。
四十倍加速背后,真正让这套仿真器站住脚的,其实是"随机耦合"这四个字。如果只是做一个更快的大气模型,那和此前的ACE2差别不大;但SamudrACE-E3SMv3把大气、海洋、海冰作为一个整体来训练,并且刻意让大气保持"随机性",这就在根上解决了确定性AI仿真器长期跑下来"变率塌陷"的顽疾。
这个顽疾有多讨厌?简单说,如果只用均方误差训练一个气候仿真器,模型学到的是所有可能天气的"平均答案"。短期预报没问题,但让它自己跑几十年,那些本来应该此起彼伏的天气波动会被一点点磨光——海表温度异常越来越平、厄尔尼诺越来越像一个节拍器,最后整个仿真器变成一台"气候复印机",只输出一个干巴巴的平均态。
从确定性到随机性:ACE2S如何为气候仿真注入内部变率
大气组件叫ACE2S ,是Ai2此前发布的ACE2大气仿真器的随机版本。它运行在1度水平分辨率(约100公里网格)、8个垂直层、6小时时间步长上。和确定性版本最大的区别在于训练目标:ACE2S用概率损失函数来训练,包括连续排序概率分数(CRPS)和能量分数。CRPS衡量的是"预测的概率分布"与"真实值"之间的距离——它不要求模型给出唯一正确的答案,而是要求模型给出的分布足够"靠谱":既不能太窄(过度自信),也不能太宽(含糊其辞)。
海洋组件叫Samudra ,是一个全深度海洋仿真器,同样1度分辨率、19个垂直层、5天时间步长。在SamudrACE框架里,它还额外预测海冰浓度和体积。论文里特别提到,这个版本用了加宽配置,把四个ConvNeXt块的通道数从原来的[160, 320, 480, 640]调整到[280, 380, 480, 520],目的是减少深层海洋特征对上层海洋的"印记"干扰。
两个组件怎么对话?大气向海洋传递5天平均的海表通量、降水和风应力;海洋向大气传递海表温度(SST)和海冰覆盖率。每个网格单元内的海洋占比、海冰占比和陆地占比在两个仿真器之间严格保持一致。下面的表S2列出了耦合过程中交换的全部变量。
训练分两步走。第一步是"各自单练":ACE2S用指定的SST和海冰做强迫,先单步随机训练30轮,再做多步展开微调30轮;Samudra则用指定的完美大气强迫做确定性预训练,先在20天展开上练150轮,再在40天展开上微调20轮。第二步是"合奏":两个组件耦合起来,联合微调40轮。每个训练样本展开4个耦合步(20天),对应4个5天海洋步和80个6小时大气步。
耦合微调的巧妙之处在于损失窗口的随机采样。每批数据里,海洋的损失窗口从{0, 1, 2, 4}个海洋步里随机抽,大气的损失窗口从{0, 1, 2, 4, 21, 41}个大气步里抽。这样做的目的,是让模型既见到短时间尺度的响应,也见过跨越多轮耦合反馈的长程信号,避免模型只学会"条件反射"式的单步预测。更关键的是,ACE2S每次生成两个集合成员,其5天平均海表强迫驱动两个对应的Samudra展开,两个组件的优化目标都是同一套概率损失。换句话说,随机的种子完全来自大气,海洋自身不注入额外噪声。
400年独立检验:平均态、降水与ENSO的保真度评估
评估方案设计得很严格:用E3SMv3的105年工业化前控制模拟做训练,其中前90年训练、5年验证、10年测试;然后让训练好的仿真器自由运行500年,取其中400年(模型年0505-0905)与E3SMv3完全独立的400年(模型年0001-0400)对比。这400年的评估长度,比原版SamudrACE论文翻了整整一倍,能更苛刻地检验长期漂移问题。
先看平均态。仿真器400年平均的表面气温和降水的均方根偏差(RMSB)分别是0.62K和0.19mm/天,而E3SMv3自身与观测的偏差是1.13K和1.04mm/天。也就是说,仿真器相对参考模型的偏差,远小于参考模型本身相对真实世界的偏差——在"学像"这件事上,它做得相当到位。
但平均态并不能说明一切。气候系统真正的难点在变率。论文用泰勒图把所有变量的空间相关性和标准差比值画在一张图上,几乎全部变量都挤在"完美点"(1,0)附近,只有平流层总水(q0)明显偏离——因为它的平均场接近均匀,微小误差被归一化放大,物理上无关紧要。
降水是检验仿真器"细活"的试金石。下图对比了全球、热带海洋和美国本土(CONUS)三个区域的日降水概率分布。仿真器把99.99百分位以内的降水分布几乎完美复现,美国本土的极端降水事件甚至在400年样本里都能对上。但在全球分布的最右端,问题出现了:热带海洋上超过150mm/天的极端降水频率被低估,仿真器在230mm/天附近截断,而E3SMv3能延伸到300mm/天以上。
ENSO是另一个重点考察对象。Niño 3.4指数(5°S-5°N, 170°W-120°W区域平均的SST异常)在400年滚动中保持稳定,没有出现方差崩溃或漂移。功率谱显示,仿真器复现了厄尔尼诺的主峰(约3-4年周期),且在4年以上低频段保持了功率,但1.5-2年周期的功率比E3SMv3低了最多50%。更重要的是,仿真器正确复现了ENSO的空间遥相关:Niño 3.4指数与全球降水、SST的回归图与E3SMv3几乎一致,包括赤道中东太平洋的暖舌、西太平洋冷异常,以及热带降水的东西向位移。
随机vs确定性:Gulf Stream区域SST变率的决定性差异
随机训练到底带来了什么?最直观的证据在墨西哥湾流延伸区(35°N-45°N, 75°W-45°W)。这个区域是海洋内变率最活跃的地方之一,海表温度异常的标准差成为检验"变率保真度"的天然标尺。
结果非常鲜明:目标E3SMv3的逐点去季节化月SST异常标准差为1.27K,确定性仿真器把它压到了0.55K——几乎腰斩;随机仿真器则缓解到0.74K。区域平均的SST指数也呈现同样趋势(0.74K vs 0.38K vs 0.49K)。功率谱上,确定性模型在整个频段(从亚季节到十年周期)都比目标低了2.5到4倍,而随机模型关闭了大约一半的差距。
更关键的是,这种变率优势并不只体现在均方根指标上。论文还对比了不同随机种子训练的模型:两个确定性种子中,有一个训练出来的模型其Niño 3.4功率谱完全崩塌——出现一个过强过窄的3年周期峰,同时在4年以上频段几乎丧失全部功率,整个指数时间序列呈现出肉眼可见的周期性振荡。而两个随机种子都给出了合理、不规则的变率,谱峰与E3SMv3的差异在2倍以内。最狡猾的是,这个"崩塌"的确定性模型在平均态指标上与正常模型毫无差别(温度RMSE 0.66K vs 0.67K,降水0.37 vs 0.41 mm/天),如果只盯平均态,你根本发现不了它已经"死"了。
海冰变率也呈现类似模式。下图显示北半球和南半球的海冰覆盖率异常标准差:确定性模型在边缘海冰区(15%等值线附近)的变率明显偏弱,而随机模型显著改善了这一点,尤其是在南北半球的高纬边缘带。
顺带一提,论文在补充材料里对比了损失函数对海洋谱结构的影响。用MSE训练的独立Samudra,在垂直模态和浅层水平谱上普遍存在小尺度功率缺失;而用集合损失微调后,几乎所有海洋通道的谱偏差都下降了。也就是说,概率目标不仅保住了大气变率,还顺带改善了海洋的动力学结构。
局限与展望:极端降水低估与未来研究方向
这篇论文的坦诚之处在于,它没有掩盖自己的短板。最突出的局限是热带极端降水的低估:超过150mm/天的降水事件频率偏低,分布尾部在230mm/天附近截断,而E3SMv3能到300mm/天以上。这种"尾部截断"是概率训练的常见副作用——当罕见事件的样本量太少时,模型倾向于把概率质量分配给更常见的量级,从而系统性低估最极端的量级。
论文提出的改进方向包括tail-weighted loss(对极端降水赋予更高损失权重)和上采样(在训练数据中重复采样罕见事件)。此外,目前的工作只针对工业化前控制气候,尚未涉及随时间变化的人为辐射强迫情景。要真正用于CMIP级别的未来情景预估,还需要在瞬变强迫条件下做额外训练和验证。
不过换个角度看,这种"尾部截断"恰恰体现了随机仿真器的诚实:它知道自己没见过足够多的极端事件,不会强行编造一个不准确的尾部。这比那些在平均态上漂亮、却把极端事件乱编一通的模型要可靠得多。
龙迷三问
这篇论文到底在解决什么问题? Ai2推出随机耦合大气-海洋仿真器SamudrACE-E3SMv3,基于E3SMv3训练,仅需单张GPU即可运行,速度比传统气候模型快40倍,400年独立评估精准再现平均态与ENSO变率。
这篇工作最值得看的点是什么? 随机仿真器在400年评估期内准确再现E3SMv3的平均气候态,SST偏差0.62K和降水偏差0.19mm/day远小于E3SMv3与观测的偏差(1.13K和1.04mm/day);ENSO功率谱与目标模型吻合良好;日降水分布精确到99.99百分位;相比确定性基线,随机训练在Gulf Stream Extension区域恢复了34%的SST变率损失。
这篇工作的边界或风险在哪里? 优点:(1) 随机训练策略有效维持了长时间尺度的内部变率,特别是ENSO和海冰变率;(2) 耦合框架在保持高精度的同时实现约40倍加速;(3) 400年独立评估提供了严格的长期保真度检验。缺点:(1) 在巴伦支海和格陵兰海的海冰边缘区存在持续偏差;(2) 低估了热带极端降水事件的频率;(3) 海洋仿真器仍为确定性,变率完全继承自随机大气。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
基于SamudrACE框架,将随机大气仿真器ACE2S与全深度海洋仿真器Samudra耦合,通过概率目标函数联合微调,实现随机耦合气候仿真。
实验合理度: ★★★★☆
400年气候平均态偏差(RMSB)、泰勒图、日降水分布直方图、Niño 3.4指数功率谱、SST变率标准差、海冰变率标准差。
学术研究价值: ★★★★☆
基于SamudrACE框架,将随机大气仿真器ACE2S与全深度海洋仿真器Samudra耦合,通过概率目标函数联合微调,实现随机耦合气候仿真;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
在单张H100 GPU上,随机版本推理速度为1105 SYPD(模拟年/天),确定性版本为1360 SYPD;相比E3SMv3在105个节点上约28 SYPD的速度,加速约40倍。
复现难度: ★★★☆☆
https://huggingface.co/allenai/SamudrACE-E3SMv3
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: (1) 在巴伦支海和格陵兰海的海冰边缘区存在持续偏差;(2) 低估了热带极端降水事件的频率;(3) 海洋仿真器仍为确定性,变率完全继承自随机大气。
主要参考文献
[1] Duncan J P C, Wu E, Arcomano T, et al. SamudrACE: A coupled atmosphere-ocean emulator[ preprint]. arXiv, 2026.
[2] Watt-Meyer O, et al. ACE2: An AI-based atmosphere model emulator for multidecadal simulations[ preprint]. 2025.
[3] Dheeshjith S, et al. Samudra: A full-depth ocean emulator for century-scale simulations[ preprint]. 2025.
[4] Golaz J C, et al. E3SMv
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!