hdy 发表于 2025-6-6 22:38

从同化到“端到端”(二)——ECMWF的思路


自一年前该系列介绍了Fengwu的两篇论文后,基于AI的数据同化和端到端天气预报又取得了一些进展。ECMWF近期也加入了这个领域,公开了不少有价值的信息和思路。今天借ECMWF的东风,再来深度聊聊这个话题。WHY:不同角度看为什么要端到端机器学习竞技场迄今为止,大部分AI天气预报模型仍基于ERA5训练和评估。天气预报此时可视为一个典型的机器学习竞技场——在一个标准数据集上做标准评估,以竞争名次。由于AI预报水平表面上已普遍超越数值模式,在这条路上“卷”下去的收益已陷入边际效应递减。为了冲击下一个头条,亟需开辟新的赛道。除概率预报、区域高分辨率、物理驱动等优化方向,另一个思路是,找一找天气预报中还有什么重大环节是仍依赖传统方法的。同化?就是它了!更好地利用观测我们在系列上一篇中介绍了同化的概念和意义。用AI来做这件事有什么可能的好处?ECMWF今年的一篇Newsletter解释得非常到位。这里浓缩转述。同化极具挑战性:
[*]观测数据的空间尺度和结构与模式网格不同,需要融合。
[*]观测数据大部分情况下并非直接测量模式变量(如卫星可能提供的是辐射),需要映射。
[*]在融合和映射的过程中,需要精确定量观测和模式中的不确定性。
因此,带来数个问题:
[*]同化过程存在很大误差。
[*]部分数据无法纳入同化框架内。
[*]占用大量计算资源,或者说,大大延迟了最新观测融入预报的时间。
由于AI可以通过大量数据自主学习融合方式或映射关系,且速度显然远超4D-Var,确实有希望改进这些问题。WHAT:端到端的不同理解ECMWF去年的一篇Newsletter总结了不同范式的AI预报模型。方式1代表目前最常见的AI模型。方式2代表用观测数据微调或评估AI模型。微软发布的Aurora模型就针对站点观测进行了评估。微软还发布了基于临场观测(包括站点和用户数据)的Benchmark——WeatherReal。这里,我们重点看方式3-5。基于AI的数据同化为了用AI驱动整个天气预报流程,本着哪里不会点哪里的心态,研发独立的模块来代替传统数据同化,与AI预报配合,是最常见的做法之一,也即前文的方式3。例如:
[*]系列上一篇介绍的Fengwu-4DVar和Fengwu-Adas;
[*]Fuxi的系列工作,如Fuxi-DA;
[*]基于扩散模型的DiffDA;
[*]微软和清华近期的合作ADAF也类似,但关注区域近地面要素的同化。
这些工作不约而同选择了传统形式,即通过AI来融合背景场(即过去的预报场)和最新观测来实现同化。如此,为传统天气预报中两大关键部件——同化和预报,建立基于AI的同位替代,达成最直接的端到端效果。端到端——AI同化+预报套餐既然AI可以用于数据同化,那自然可以和预报模型打包形成一套端到端的解决方案。该方向近期最有影响力的工作是发表在Nature正刊上的Aardvark。Aardvark的设计非常……朴素。模型分为三个部分:
[*]Encoder将观测同化为初始分析场,训练目标是同时刻的ERA5,对应上文方式3。为了处理不规则分布的观测,使用了SetConv技术(原理不再赘述)。
[*]Processor接在Encoder后负责预报,本质上是另一个Pangu、GraphCast,训练目标是下一时刻的ERA5,对应上文方式1。
[*]Decoder每个时间步分别训练,负责将Processor的预报后处理到站点上,训练目标设为站点观测,对应上文方式2。
为了让这套其实是低配AI同化(有限的观测)+低配AI预报(分辨率为1.5°,24小时)+低配AI后处理(每个Decoder200万参数,30分钟训练完成)的模型拼盘发挥端到端的优势,训练阶段包含将三个部分联合微调的步骤。尽管如此,仍推荐读一读这篇论文。技术和配置对于Nature也许并不关键,重要的是,如何讲好一个故事:用AI代替整个天气预报流程,速度更快,成本更低,部署更方便,优化更容易。用户可以用它来代替数值模式(因为它代替了整个预报系统),可以根据自己的需求微调(因为它支持在散点观测上微调)。当每个简陋的模块都能在这个故事背景里找到自己的价值,它就成了一篇Nature。微软近期推出的区域端到端模型OMG-HD与此有一定相似性。总之,这里的端到端是指仅利用原始观测提供格点化预报,搭建的AI模型在“同化+预报”的框架内利用(再)分析数据的知识训练,并在运行时只依赖原始观测。可以认为他们实现了方式4,但本质是方式3(AI同化)和1(AI预报)的组合。至少,这种方法的优势之一是节省了本来消耗在同化上的巨量时间,大大缩短了预报延迟。其他相关工作还有潘宝祥老师团队的成果,有别于以上工作,需要另文详解。在观测空间直接预报等一等,端到端到底是什么意思?在深度学习领域,可能指用AI完成从原始数据到预报目标的整个流程,或不需要人为设计阶段目标并分步训练。以上模型不同程度地达成了这些目的。但更进一步,端到端也可以指:
[*]知识完全从数据中挖掘,不依赖任何人类经验。
[*]不对输入按人为理解做预处理或特征工程。
具体到端到端天气预报模型,应该做到以下两点:
[*]从训练阶段开始,不使用任何(再)分析数据。(再)分析数据来自数值模式,显然包含了人类经验(或物理知识)。正如我们之前的文章提过,Pangu、GraphCast既是预报模型,也是IFS模拟器。
[*]去除传统的同化步骤。这条要求不那么显性,需要梳理下逻辑。
回到开头我们提到的:同化表示将数据从观测空间转换到模式空间,这包括将观测信息融合到人为设置的空间格点上,并映射为模式中采用的物理变量。这本质上仍是按对大气系统的人为理解,将输入做了预处理。更重要的是,当AI模型中设置了同化模块时,它的训练目标该设定为什么呢——显然,一旦有了同化,(再)分析数据的使用几乎不可避免。去除(再)分析数据和同化模块后,剩下的选择就是我们小节的标题了:在观测空间直接预报(Direct Observation Prediction,DOP),将模型的输入输出都设置为观测场,也即是上文的方式5。先将这个思路是否现实放到一边,看看这样做的优势。
[*]首先,省略了同化中模式和观测空间的融合和映射。我们也不再需要诸如观测算子、误差协方差甚至切线性和伴随模式等一系列精细化操作。
[*]模型可以从任意观测中学习,甚至包括数值模式中尚未使用的那些——如果训练以(再)分析为目标,那么在输入中增加数值模式里未同化的数据,其实际效果是可疑的。而DOP没有这个问题。
[*]同样,彻底摆脱了(再)分析数据的限制,DOP的理论上限将高于数值模式。例如一些次网格过程在数值模式中用参数化方式模拟,而DOP可以直接从观测空间中学习这些过程在更大尺度上的反馈结果。
更多讨论,仍请可以参见ECMWF的Newsletter。HOW:GraphDOP简介DOP的结构ECMWF对DOP的初步尝试已经形成一篇论文,称为GraphDOP。我在读博面试时,一位老师考过我:ECMWF最大的优势是什么?我胡诌了些什么已经记不清楚,但老师答了两个字:同化。这至少意味着ECMWF对原始观测数据的理解全球领先,也让ECMWF成为可能是最适合尝试DOP路线的团队。这里,我们不深入解释ECMWF是如何在GraphDOP中使用观测的(但强烈推荐阅读该论文),而是来看看模型的设计。
[*]12小时窗口内不规则分布的各类观测传入图神经网络,编码到隐空间。当然,这一步也可以被视作同化,区别是:它并没有被转换到预先设计的模式空间;训练中也没有任何学习目标。
[*]格点化的隐空间以Transformer为骨干网络rollout到后续时次。即自回归的形式仍然存在,但在隐空间内进行。
[*]每个时次的隐空间通过图神经网络解码器解码回观测空间,并与对应时次的观测计算损失以优化模型。
简而言之,GraphDOP仍然采用类似GraphCast和AIFS的encoder-processor-decoder架构,区别是彻底移除了ERA5。DOP的挑战抛开ECMWF在观测数据上的功夫全球独家,其他团队很难追赶,DOP形式的模型仍存在很多挑战。去除再分析数据的桎梏是把双刃剑。一些原始观测的固有问题再次暴露出来。例如,不同观测数据的时间跨度不一,GraphDOP的选择是用2004-2021年的数据训练。不同时期的观测差异也要求模型识别数据中的漂移。由于缺乏格点化的信息,DOP的一大任务是空间泛化。无论是极轨卫星、静止卫星或散点观测,DOP需要将观测信息泛化到缺乏观测的区域,毕竟无论是预报员还是用户,都可能需要覆盖全球任意位置的天气预报。例如,200hPa风速的观测来自无线电探空仪(下图左),模型则支持输出全球格点化的风速(下图右)。当然,稀疏观测的空间泛化显然不能仅靠单一变量,而需要学习不同观测间的联系,这需要理解物理。然而,观测空间中的变量归根结底并不是我们想要的(例如辐射不仅受温度影响),也不直接代表大气的动力学过程。这无疑给模型增加了负担,也要求对观测数据源的选择更加可靠。原来属于同化的部分工作,如模式空间与观测空间的转换,可能实际上隐式交给了模型自主学习。与此相关的一项例证是,尽管对2米气温的同化并不是IFS的强项(直到去年2米气温才被同化到业务模式中),而GraphDOP直接同化了站点观测,但在72小时、120小时预报中,GraphDOP相比IFS并没有优势:这与其他AI模型优势逐渐放大的特点相反。更麻烦的是,一些高阶变量压根没有直接观测,比如海冰密集度。这降低了模型和现有业务的匹配度。最后,由于一切都在观测空间进行,传统同化中的“背景场”概念变得没有意义。但不能忽略的是,“背景场”除了提供密集的格点信息外,本身也是一种气候态约束。进一步,背景场本身是预报,实际上将同化窗口前的观测信息通过预报部分传递了下来,类似于深度学习中的循环神经网络(RNN),而GraphDOP显然做不到这一点。结语如果一定要给端到端找到一个本质原理,那可能是通过堆数据规模来放飞模型,提升其上限。传统数值预报虽然基于扎实的理论,但也包含经验和统计性质的成分,因而跷跷板现象——看似优化了某个组件,却拖累了整体性能——也并不稀奇。时空分辨率、物理一致性等限制也某种程度上制约了最终的表现。建立端到端的AI预报体系很大程度上规避了这些问题。然而,现有的观测数据似乎又没有丰富到理想的量级以支撑纯粹的“自动驾驶”。因而在向前迈了一大步后,可能还得往回找补一些。例如,在GraphDOP中,作者可以一方面强调AI方法在卫星同化中的优势,即天然的“全天候同化”,而数值模式中云和降水区的微波观测不参与同化,或通过复杂的湿物理参数化方案和辐射传输模式来实现;另一方面,又在Discussion中反思未来可能需要通过增加晴空数据的权重,来优化预报。另外,我们在大量AI模型实例中看到,与数值模式不同,AI模型的性能似乎并不显著依赖于其时空分辨率,这可能也是ECMWF敢于直接在原始观测编码成的隐空间上运行预报,甚至猜测映射到精细网格可能反而拖累了AI模型的原因。但从事实出发,在基于ERA5的AI模型可以轻易超越IFS的今天,DOP交出的答卷显然还不够令人满意。

页: [1]
查看完整版本: 从同化到“端到端”(二)——ECMWF的思路