地球AI天气模型,能预测火星天气吗?现在地球上的AI天气预报已经卷到起飞。GraphCast是DeepMind在2023年推出的图神经网络天气模型,在Science上发表,用再分析数据训练后,中短期预报精度一度超越传统数值天气预报系统,而且推理速度快了几个数量级。它的核心架构是编码器-处理器-解码器三段式,将全球大气状态表示为多尺度网格图,通过消息传递机制在图上迭代更新特征,从而捕捉大气动力过程中的空间依赖关系。GraphCast在ERA5再分析数据上训练,输入当前时刻和六小时前的大气状态,输出未来六小时的预报,再通过自回归滚动生成中长期预报。这种设计让它在预报技巧和计算效率之间取得了很好的平衡,也让它成为后续各种迁移实验的理想起点。 这就带来一个哲学级的问题:一个在地球数据上学出来的天气模型,除了预报地球天气,能不能用来预报别的星球?从科学角度看,这其实是在问:大气动力学的基本方程——纳维-斯托克斯方程、热力学方程、辐射传输方程——在无量纲化之后,是否具有跨行星的普适性?地球和火星虽然大气成分、气压、温度范围差异巨大,但都是旋转球体上的流体,都受太阳辐射驱动,都有季节变化和昼夜循环。如果AI模型学到的是这些底层物理规律,那么迁移到火星应该可行;如果它只是记住了地球气候的统计特征,那么迁移必然失败。这个问题不仅关乎AI天气模型的泛化能力,也关乎我们对“基础模型”本质的理解——它到底是学会了物理,还是学会了数据分布? NASA的研究人员就真的去试了。论文标题很直接:MarsCast: Transfer Learning of AI Weather Foundation Models to Planetary Atmospheres,把地球天气基础模型迁移到火星大气。这项工作由NASA高级超级计算中心(NAS)的研究团队完成,他们选择了GraphCast作为基础模型,因为它的权重和代码完全开源,且在图神经网络架构上具有较好的可移植性。论文的核心贡献在于:第一,系统评估了零样本迁移的可行性,揭示了地球物理先验在火星上的失效模式;第二,提出了一套完整的数据适配和微调流程,仅用少量火星数据就实现了有效的跨行星迁移;第三,对迁移后的模型进行了多维度评估,包括垂直结构、季节变化、风场等,展示了其在实际任务中的潜力。 把GraphCast搬到火星有几个直接的现实动机。火星任务的着陆、EDL(进入-下降-着陆)阶段特别看天气,沙尘暴可能全球蔓延,昼夜温差动辄上百摄氏度,而传统火星全球气候模型(MGCM,Mars Global Climate Model)跑一次预报太贵了。MGCM是基于物理方程的大气环流模型,需要在超级计算机上运行数小时甚至数天才能完成一次预报,而且分辨率通常较粗,难以捕捉局地天气特征。如果能有一个又快又准的AI预报器,对任务规划和风险控制都是好事。具体来说,EDL阶段需要知道着陆区的风场、温度、密度廓线,这些参数直接影响降落伞的展开时机和着陆精度;表面巡视任务需要规划每日的热负荷,避免设备过热或过冷;沙尘暴预警则需要快速更新的大范围天气图。这些场景都对预报的时效性提出了很高要求,而AI模型恰好在这方面具有天然优势。 但要迁移不是换个输入就能跑的。火星大气和地球差异巨大:大气主要成分是CO₂,表面气压只有地球的约一百五十分之一,没有海洋,沙尘辐射强迫非常强,地形起伏也极端(比如塔尔西斯火山和希腊盆地)。这些差异让地球模型里隐含的物理假设在火星上大概率是失效的。例如,GraphCast的辐射参数化是基于地球大气成分(主要是水汽、臭氧、二氧化碳的混合)调校的,而火星大气几乎全是二氧化碳,辐射传输特性完全不同;边界层参数化假设了地球的热惯性范围,而火星地表热惯性极低,昼夜温度变化剧烈;水汽循环模块在火星上几乎没有意义,因为火星大气水汽含量极低。这些物理过程的不匹配,意味着零样本迁移几乎不可能成功,必须通过微调让模型重新校准这些参数。 论文把问题拆成两阶段来验证:先做零样本测试,看看不微调时模型表现如何;再设计微调策略,把GraphCast适配成专门的火星预报模型MarsCast。本文就来把这条迁移之路一步步拆开看看。在展开技术细节之前,有必要先明确几个关键概念:所谓“零样本”,是指直接用预训练权重进行推理,不做任何针对火星的梯度更新;所谓“微调”,是指在预训练权重的基础上,用火星数据继续训练,但学习率通常取得很小,以避免破坏已经学到的通用表征。这两个阶段的对比,可以清晰地揭示模型哪些能力是通用的、哪些能力是地球特有的。 零样本翻车:火星的昼夜循环为何消失?
零样本(zero-shot)的意思是:不进行任何针对火星的重新训练,直接拿预训练好的GraphCast,用火星大气状态作为初始场,让它自动回归地往下预报。这样能测出:地球大气动力学知识到底有多少具有普适性,能直接迁移到火星上。具体操作上,论文将MCD提供的火星大气状态(包括温度、风场、位势等变量)按照GraphCast的输入格式进行编码,然后让模型以6小时为步长自回归地生成预报。这里有一个关键细节:GraphCast的输入变量包括2米温度、10米风场、6小时累积降水等地球特有的变量,而火星上没有降水,也没有对应的海洋表面温度,因此论文需要做变量映射和缺失值处理。 结果显示,零样本GraphCast确实能生成一些有物理意义的天气尺度特征,比如在初始时刻能保持火星的某些大尺度温度梯度和气压波结构。这说明模型确实学到了一些通用的流体动力学规律,比如地转平衡、斜压不稳定等,这些规律在火星上同样适用。但问题很快就暴露了:模型输出在几步之内迅速向气候平均态坍缩,温度梯度越来越弱,而且完全没有火星标志性的昼夜循环。所谓“向气候平均态坍缩”,是指模型的预报逐渐失去空间变率和时间变化,最终收敛到一个平滑的、接近气候平均的场。这种现象在AI天气模型中并不罕见,通常是因为模型在训练时学到了“最小化均方误差”的策略,而均方误差的最优解就是条件均值,即气候平均态。当模型对输入数据的物理过程不够敏感时,它就会倾向于输出一个“安全”的平均值,而不是冒险预测具体的天气系统。 火星的昼夜循环有多夸张?由于大气稀薄、热惯性小,火星地表昼夜温差动辄80到100摄氏度,太阳一落山温度就骤降。如此强烈的日变化驱动着火星的主要大气活动,包括热力潮汐和局地环流。热力潮汐是太阳加热在地球和火星大气中都会激发的大气波动,但在火星上由于温差极大,潮汐振幅远大于地球。局地环流则包括山谷风、坡风等,这些现象在火星的复杂地形下非常显著。而GraphCast学的模式里,辐射参数化、边界层过程和水汽循环都是按地球参数来调的,根本hold不住火星的辐射热力过程。具体来说,地球的辐射参数化假设大气对太阳短波辐射的吸收主要来自水汽和臭氧,而火星大气对太阳辐射的吸收主要来自二氧化碳和沙尘;地球的边界层参数化假设地表热惯性较高,温度日变化平缓,而火星地表热惯性极低,温度日变化剧烈。这些差异导致模型无法正确模拟火星的日循环。 零样本失败的深层原因很清楚:基础模型里的物理先验是地球的辐射平衡。火星CO₂主导、无海洋、低气压,热力强迫机制差别太大,模型没有相应的物理强项去生成逐日的加热冷却循环。这说明大气动力学的“底层几何”可以通用,但“物理参数认知”是强烈依赖训练分布的。换句话说,模型学会了“流体如何在旋转球面上运动”这个通用规律,但没有学会“火星大气如何被太阳加热”这个特定规律。这就像一个人学会了游泳的基本动作,但换到不同密度的液体中,需要重新调整发力方式。这个发现本身就有重要的科学价值:它告诉我们,AI天气模型的迁移能力是有边界的,边界就在于物理参数化的适用性。 ![]()
图1:零样本(未微调)GraphCast生成的24小时预报,时间步长为6小时。第一行为火星气候数据库参考场,第二行为训练损失,第三行为模型预测,最下面一行是预测与参考场的差值。可以看到预测快速失去空间细节,昼夜温度波动完全缺失。从图中可以直观地看到,预测场在几个时间步之后就变得非常平滑,温度梯度几乎消失,而参考场中明显的昼夜温差和地形强迫特征在预测中完全看不到。这种坍缩现象在零样本迁移中几乎是必然的,因为模型从未见过火星这种极端的热力强迫条件。 微调10个epoch,火星日循环重现
既然零样本不行,就该微调了。传统的火星气候模型要么从物理方程出发求解,要么从零开始训练一个AI模型,这两者都需要大量算力和工程时间。本文的策略是在GraphCast预训练权重的基础上继续训练,只需要少量火星数据。这种迁移学习的思路在计算机视觉和自然语言处理领域已经非常成熟,但在行星科学领域还是首次。微调的核心思想是:预训练模型已经学会了通用的特征表示,我们只需要在少量目标域数据上做“适应性调整”,而不需要从头学习。对于天气模型来说,这意味着模型已经理解了大气动力学的通用规律,我们只需要让它适应火星的特定物理参数。 微调之前先做数据变形。由于GraphCast在ERA5再分析数据上预训练,温度等统计量都是地球范围,直接把火星温度塞进去会导致激活饱和或不匹配,所以要先将火星变量做一次线性缩放,映射到ERA5的动态范围。具体做法是: Tscaled = (TMars − TMars_min) / (TMars_max − TMars_min) × (TERA5_max − TERA5_min) + TERA5_min 其中TMars是原始火星变量,TMars_min和TMars_max是火星变量的最小值和最大值,TERA5_min和TERA5_max是ERA5数据中对应变量的最小值和最大值,Tscaled是缩放后输入模型的火星变量。这个线性映射确保了火星数据的数值范围与地球数据大致一致,避免了激活函数饱和或梯度消失的问题。值得注意的是,这种标准化方式保留了火星数据的相对变化信息,只是将绝对数值映射到了模型熟悉的范围内。 湿度被设置为全球平均值并保持不变,因为火星水汽稀少,暂时不想把维度搞复杂。另外火星没有海洋,海陆掩膜直接全部置1。这些简化处理虽然损失了一些物理真实性,但大大降低了微调的难度。论文作者在讨论中也提到,后续工作可以考虑将湿度替换为沙尘质量混合比等火星特有的变量,以捕捉沙尘暴等关键过程。 输入变量上,增加了一项关键强迫——大气层顶(TOA,Top-of-Atmosphere)太阳辐射强迫。火星的日循环主要是太阳辐射直接驱动的,模型必须接收这个信号才能学会日变化。论文用太阳经度(Ls,Solar Longitude)表示季节,把一整个火星年离散成360个值,并且在一天内的00时、06时、12时、18时四个时刻采样,构造了(T00, T06 → T12)、(T06, T12 → T18)、(T12, T18 → T00)、(T18, T00 → T06)四组时间步进训练样本,正好覆盖完整的昼夜加热和冷却过程。这种构造方式确保了模型在每个训练样本中都能看到太阳辐射的日变化信号,从而学会将辐射强迫与温度响应关联起来。 微调训练用了AdamW优化器,学习率只有1×10⁻⁶,损失函数用MSE(均方误差,Mean Squared Error),整个网络的编码器-处理器-解码器全部解冻。用这么小的学习率是要在保留预训练所学空间表征的前提下,让它学会火星特有的物理量级。学习率的选择是迁移学习中的关键超参数:太大会破坏预训练权重,导致灾难性遗忘;太小则收敛过慢。论文作者通过实验发现1×10⁻⁶是一个合适的折中,既能让模型适应火星数据,又不会破坏地球上学到的通用特征。 效果令人惊讶:只用随机抽取的30天火星数据,微调大约10个epoch,模型就已经开始出现日循环的雏形,温度振幅和空间梯度随训练进一步改善。训练到约1000个epoch后误差控制在±2开尔文以内。只花几十个GPU小时就完成了从地球天气模型到火星天气模型的转变,这在传统大气模拟里几乎不敢想。这一阶段展示了迁移学习巨大的成本优势。值得注意的是,10个epoch的微调虽然已经能捕捉日循环的基本特征,但误差仍然较大;随着训练继续,模型逐渐学会了更多细节,比如地形强迫、季节变化等。这说明迁移学习是一个渐进的过程,模型先学会最显著的信号(日循环),再逐步学习更细微的模式。 ![]()
图2:用30天随机样本微调GraphCast仅10个epoch(左侧)后的24小时2米温度预报,日循环已经开始显现;训练约1000个epoch后(右侧)日循环完全建立,大多数地区误差小于±2度。从图中可以清晰地看到,10个epoch的预报虽然已经有了昼夜温差,但空间分布还不够精细,误差较大;而1000个epoch后,预报场与参考场几乎无法区分,误差控制在极小的范围内。这种快速收敛的现象说明,火星大气的热力过程虽然与地球不同,但其复杂度可能低于地球——毕竟火星没有海洋、没有云层、没有降水,大气过程相对简单。 论文还尝试了不同训练样本量(30天、100天、360天),发现样本量越大,预测误差越低,但仅30天数据就已经能给出可用的日循环预报。也就是说,火星天气的“日循环规则”其实相对简单,模型一旦抓住了太阳辐射强迫与温度响应的映射,就能快速泛化。这个发现对实际应用很有意义:火星的观测数据非常稀缺,如果能用少量数据就训练出可用的预报模型,那么对于未来的火星任务将是一个巨大的优势。论文还发现,样本量越大,模型在长时间预报中的稳定性越好,说明更多的数据有助于模型学习更稳健的物理规律。 ![]()
图S12:训练样本量分别为30天(顶部)、100天(中部)和360天(底部)时,前24小时预报(6小时步长)与MCD参考值的差值。每种情况都微调到100个epoch,更大的样本量需要更多训练时间才能完全收敛,但仅30天数据加少量微调已经足以证明迁移能力。从图中可以看出,30天样本的误差虽然稍大,但整体空间分布已经与参考场基本一致;100天和360天样本的误差进一步减小,尤其是在地形复杂的区域。这说明样本量对模型性能有正面影响,但边际效益递减。 ![]()
图S11:训练损失(MSE)随训练步数变化(每epoch约120步)。训练进行了1000个epoch,前300个epoch(约40000步)损失显著下降,超过700个epoch(约80000步)后仍有缓慢改善。这说明基础模型的表征容量很大,微调并不是从头学,而是“重新校准”到一个新星球的热力规律。损失曲线的形状也很有意思:前期快速下降,后期缓慢收敛,这符合迁移学习的典型特征——模型先快速适应目标域的大致分布,再慢慢精调细节。 ![]()
表1:GraphCast的输入变量与用于微调GraphCast的火星MCD对应输入变量的对照,以及用于模拟GraphCast 13个气压层的13个垂直高度层级。MCD原始数据为5.625°×3.75°分辨率,通过双线性插值到1°×1°网格;气压层级对应50、100、200、250、300、400、500、600、700、850、925和1000 Pa。这张表清晰地展示了变量映射的细节:地球的2米温度对应火星的2米温度,地球的10米风场对应火星的10米风场,地球的位势高度对应火星的位势高度,等等。对于地球特有的变量(如降水、海表温度),论文用常数或零值填充。 ![]()
表S1:数据标准化配置、将火星适配到地球测量的调整以及模型参数。由于火星没有水体,海陆掩码设为1;由于模型较大,初始学习率取得较小(1×10⁻⁶)。表中还列出了每个变量的标准化均值和标准差,这些参数在微调前需要根据火星数据重新计算。 垂直温度、季节变化与风场——深度检验MarsCast
表面温度学会了,更深入的问题是:垂直方向上,火星大气温度结构能否被模型还原?这是一个更严格的测试,因为垂直温度廓线直接反映了模型对辐射传输、对流和波动过程的理解。如果模型只是在表面温度上拟合得好,但垂直结构完全错误,那么它的实用价值就大打折扣——毕竟EDL阶段需要知道大气密度随高度的变化,而这正是由垂直温度廓线决定的。 GraphCast本身有13个垂直层。为了和火星对应,论文在MCD(火星气候数据库,Mars Climate Database)中选了13个海拔高度层,对应约50至1000 Pa的气压范围,与GraphCast的气压层级大致匹配。以凤凰号火星着陆点(68.22°N,234.25°E)为例,预报时效从6小时到78小时的垂直温度廓线显示,模型在250到800 Pa这一中层大气范围内与MCD参考数据吻合得最好,近地面(约850 Pa附近)和高层(200 Pa以下)误差稍大,且随预报时效增长而放大。整体来看,垂直温度梯度和近地面结构被保住了,这在迁移学习的语境下已经是很不错的成绩。中层大气吻合最好的原因可能在于,这一层的温度主要由大尺度动力过程控制,而这些过程在不同行星上具有相似性;近地面则受地表热力过程影响大,模型需要更精细的边界层参数化;高层则受波动和辐射过程影响大,模型对高频变化的捕捉能力有限。 ![]()
图3:MarsCast(橙色)与火星气候数据库MCD(蓝色)在凤凰号火星着陆点(68.22°N,234.25°E)的垂直温度廓线对比,预报时效分别为6、30、54和78小时。可以看到中层大气(约250-800 Pa)吻合最好,近地面和高层误差随预报时效逐渐放大。从图中可以直观地看到,在6小时预报中,模型几乎完美地重现了参考廓线;随着预报时效延长,误差逐渐累积,但整体形状仍然保持正确。这说明模型对垂直温度结构的把握是稳健的,误差主要来自长时间积分中的误差累积。 季节性是另一个关键维度。火星的自转轴倾角与地球接近,所以也有四季变化,但火星轨道偏心率更大,季节差异更复杂。火星的轨道偏心率约为0.093,而地球约为0.017,这意味着火星在近日点和远日点接收的太阳辐射差异更大,季节变化更加剧烈。论文把预报分为Ls=60°、150°、240°、330°四个代表性季节初始化时刻,分别做96小时预报。700 Pa等压面的误差图显示:各个季节起报,误差的空间分布都相对均匀,没有出现某个季节彻底崩溃的情况。Ls=240°附近的沙尘暴多发季节,模型照样保持稳定。这个结果令人鼓舞,说明模型不仅学会了日循环,还学会了季节变化的规律。 ![]()
图4:MarsCast在700 Pa气压层上的温度预报误差随季节的变化。四行分别对应Ls=60°、120°、240°、330°四个代表性太阳经度初始化的96小时预报,四列对应24、48、72、96小时预报时效。颜色表示MarsCast与MCD参考场的温度差(MarsCast − MCD),负值表示冷偏差,正值表示暖偏差。各季节均保持了稳定的预报技巧。从图中可以看出,误差的空间分布在不同季节之间没有显著差异,说明模型对季节变化的适应是均匀的。值得注意的是,在Ls=240°(北半球秋季,沙尘暴多发季节),误差并没有明显增大,这说明模型对沙尘辐射强迫的响应可能还不够敏感,但也说明它不会因为沙尘暴而崩溃。 再往深看,误差的垂直分布有明显规律。Ls=240°起报的96小时预报中,2米气温和700 Pa的误差始终较小且大致围绕零值分布;到了50 Pa高度,误差明显增大且随时间增长更快。这符合火星高层大气波动更活跃、受潮汐和沙尘影响更大的物理事实,也说明模型对低层热力过程的学习更充分。高层大气的误差增大可能源于两个原因:一是高层大气的变率本身更大,二是模型在高层缺乏足够的观测约束。对于实际应用来说,如果任务主要关注近地面天气(如着陆、巡视),那么模型的性能已经足够;如果任务需要关注高层大气(如轨道器进入),则需要进一步改进。 ![]()
图5:Ls=240°初始化的96小时预报中MarsCast温度误差的垂直分布。行分别代表2米表面温度、700 Pa和50 Pa温度场,列对应24、48、72、96小时预报时效。低层误差小且围绕零值分布,50 Pa高层误差明显增大,反映高层大气动力学变率更强。从图中可以清晰地看到误差随高度和时间的变化规律:低层误差始终在±2 K以内,而高层误差在96小时时可达±10 K以上。这种垂直差异在物理上是合理的,因为高层大气受太阳辐射变化和行星波的影响更大。 最后是风场。最初实验里风场被固定为全球平均,只训练温度场。最后一个实验把风场也放开,使MarsCast能同时预报水平风的U、V分量。下图给出一个完整火星日的10米风场与温度预报:大尺度温度分布被准确重现,水平风场的环流形态与MCD高度一致,预报前48小时风速误差大多在±4 m/s以内,温度误差集中在±2 K以内,没有明显系统性偏差。风场的成功预测意义重大,因为风场直接关系到着陆的安全性和巡视器的能源规划。火星的风虽然比地球弱(表面气压低,空气密度小),但在沙尘暴期间风速可以超过30 m/s,对任务构成威胁。 ![]()
图6:MarsCast预测与MCD参考场在一个火星昼夜循环内的对比。顶部行为预测的近地表(10米)温度(颜色)和水平风矢量,中间行为MCD参考场,底部行为温度差(MarsCast − MCD)叠加风矢量差。直方图总结了每个预报时刻的温度误差分布。MarsCast准确重现了大尺度温度分布和近地表风场环流,温度差一般在±2 K以内,风速差在约±4 m/s以内。从图中可以看到,模型不仅抓住了温度的空间分布,还重现了风场的辐合辐散结构,比如在塔尔西斯火山区域的下坡风。这种细节的捕捉说明模型确实学到了火星地形的动力效应。 算力碾压与未来火星应用
速度是AI预报对传统物理模型最具碾压性的优势。论文对比了两种方式产生10天预报的成本:MarsCast用1块GPU约2分钟生成1°分辨率的全球预报;传统MGCM物理模型用1个CPU约30分钟才生成5°分辨率的预报。别小看这个差距,MarsCast处理的数据量是物理模型的25倍,而耗时反而只有它的十五分之一左右。这种计算效率的差异来自于AI模型的前向传播本质上只是一系列矩阵乘法,而物理模型需要数值求解偏微分方程组,每一步都需要迭代收敛。对于需要快速响应的任务场景,这种速度优势是决定性的。 低成本带来两个关键红利。其一,集合预报成本大幅下降,可以跑几十个扰动成员来估计预报不确定性,这在任务决策中价值巨大。传统物理模型做集合预报需要消耗大量计算资源,通常只能跑几个成员;而AI模型可以轻松跑几十个甚至上百个成员,从而更准确地刻画预报的不确定性。其二,分辨率红利:MCD原生分辨率只有3.75°×5.625°,通过双线性插值到1°,再用MarsCast做预报,输出结果能捕捉到一些更细的尺度特征,相当于模型自己补出了粗网格输入中原本没有的中尺度细节。这种“超分辨率”效应在AI模型中并不罕见,因为模型在训练时见过大量高分辨率的地球数据,学会了从粗尺度推断细尺度的能力。 放到实际火星任务场景里:EDL阶段需要对着陆区风场和温度有较准确的短临预报,表面巡视需要规划每日热负荷,沙尘暴来袭时可能需要大范围快速预警。传统MGCM在这些场景中要么太慢,要么难以支撑集合预报。MarsCast虽然目前是在历史数据上做回算验证,但已经展示出操作化部署的潜力。未来把数据源换成同化观测或更细的逐日MGCM预报场,训练一个专用版本用于任务支持是完全可行的。例如,可以将火星轨道器的温度探测数据同化到MCD中,生成更接近真实大气状态的初始场,然后用MarsCast做快速预报。这种“数据同化+AI预报”的组合模式,有望成为未来行星天气预报的标准范式。 论文的代码和模型权重已经在GitHub和Hugging Face上开源,感兴趣的同学可以直接上手复现,项目地址是github.com/nasa-nccs-hpda/GraphCastMars。开源不仅有助于学术界的复现和验证,也为其他行星(如金星、泰坦)的迁移研究提供了参考。事实上,这套方法可以推广到任何有大气环流数据的行星或卫星,只要我们能构造出合适的输入变量和标准化方式。 龙迷三问
下面是龙哥对于大家可能的一些问题的解答: 这篇论文到底在解决什么问题?NASA戈达德团队将地球天气基础模型GraphCast迁移到火星大气预报,零样本预测虽能描绘大致形态却丢失昼夜循环,仅用30天火星数据微调约10个epoch即恢复昼夜温度变化,1… 这篇工作最值得看的点是什么?微调后模型能够捕获火星日循环和季节变化,温度误差大多在±2 K内,风速误差在前48小时约±4 m/s;垂直剖面在中层大气(250-800 Pa)精度高,上层大气误差较大。 这篇工作的边界或风险在哪里?优点:迁移学习策略有效,训练成本低,推理速度快,能够利用少量数据快速适应新行星环境,且能生成比原始数据更高分辨率的预报。缺点:湿度被固定为常数,未考虑尘埃循环与真实水循环;未与实际火星观测数据验证;风场误差随预报时长增加而增大;垂直层数限… 如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~ 龙哥点评
论文创新性分数:★★★☆☆
迁移对象和场景新——首次把地球训练的天气基础模型微调到火星,但方法上主要是对已有GraphCast做数据适配和微调,整体属于应用型创新。不过,这种“跨行星迁移”的验证本身具有重要的科学意义,它为AI基础模型的泛化能力提供了新的证据。实验合理度:★★★★☆
零样本、微调、多季节初始化、垂直结构、风场、样本量敏感性等实验设计覆盖全面,对比逻辑清晰,结论可信。实验设计上,论文既验证了“为什么零样本不行”,也验证了“微调为什么能行”,逻辑链条完整。学术研究价值:★★★★☆
证明了跨行星大气迁移的可行性,给出了一个成本极低的AI行星预报路线,对行星科学和AI4Science都有启发意义。这项工作为“基础模型是否真的学到了物理规律”这一争论提供了实证数据。稳定性:★★★☆☆
低层大气预报相对稳定,但50 Pa高层误差随预报时效显著增大,湿度恒定和全陆地假设对长期模拟的影响尚未评估。对于实际任务来说,高层大气的误差可能影响轨道器进入策略的制定。适应性以及泛化能力:★★★☆☆
目前只验证了温度和风场的迁移,沙尘、水汽等火星关键过程尚未建模;方法本身对其他行星理论上可迁移,但需要逐个验证。例如,金星的大气超旋转现象、泰坦的甲烷循环,都需要不同的物理假设。硬件需求及成本:★★★★★
微调只需单GPU几十个小时,推理2分钟出10天1°分辨率全球预报,成本极低。这种成本优势使得AI预报可以广泛应用于任务规划、科学分析甚至实时决策。复现难度:★★★★☆
代码和模型权重已开源(GitHub + Hugging Face),但需要MCD数据访问权限和约50GB磁盘空间,有一定门槛。MCD数据可以从欧洲行星科学数据中心免费获取,但需要注册申请。产品化成熟度:★★★☆☆
演示效果良好,但尚缺与真实火星观测的系统性对比验证,距任务操作级部署还有距离。未来的工作需要用火星轨道器和着陆器的实际观测数据来验证模型的预报技巧。可能的问题:论文以MCD模拟数据为验证真值,未与火星轨道器或着陆器观测对比,真实预报能力验证不足;湿度恒定和全陆地的简化假设对长期模拟的影响尚未评估;高层大气(50 Pa)误差较大,而这一层对EDL等任务恰恰很关键。此外,模型对沙尘暴的预报能力尚未验证,而沙尘暴是火星天气中最具威胁性的现象之一。
主要参考文献
Lam, R., Sanchez-Gonzalez, A., Willson, M., et al. Learning skillful medium-range global weather forecasting. Science 382, 1416–1421 (2023). Millour, E., Forget, F., Spiga, A., et al. The Mars Climate Database, MCD version 6. EPSC2024-516 (2024). Bi, K., Xie, L., Zhang, H., et al. Accurate medium-range global weather forecasting with 3D neural networks. Nature 619, 533–538 (2023). Bodnar, C., Bruinsma, W.P., Lucic, A., et al. A foundation model for the Earth system. Nature 641, 1180–1187 (2025). Forget, F., Hourdin, F., Fournier, R., et al. Improved general circulation models of the Martian atmosphere from the surface to above 80 km. J. Geophys. Res. 104, 24155–24175 (1999). 项目地址:https://github.com/nasa-nccs-hpda/GraphCastMars
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
![]()
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!