我们从2011年坚守至今,只想做存粹的技术论坛。  由于网站在外面,点击附件后要很长世间才弹出下载,请耐心等待,勿重复点击不要用Edge和IE浏览器下载,否则提示不安全下载不了

 找回密码
 立即注册
搜索
查看: 232|回复: 0

[IT/数码] 从同化到“端到端”(二)——ECMWF的思路

[复制链接]
  • 打卡等级:以坛为家II
  • 打卡总天数:198
  • 打卡月天数:0
  • 打卡总奖励:714
  • 最近打卡:2025-11-21 20:33:51

1940

主题

405

回帖

1712

积分

二级逆天

积分
1712
发表于 2025-6-6 22:38 | 显示全部楼层 |阅读模式

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区

您需要 登录 才可以下载或查看,没有账号?立即注册

×

自一年前该系列介绍了Fengwu的两篇论文后,基于AI的数据同化和端到端天气预报又取得了一些进展。ECMWF近期也加入了这个领域,公开了不少有价值的信息和思路。今天借ECMWF的东风,再来深度聊聊这个话题。

WHY:不同角度看为什么要端到端
机器学习竞技场

迄今为止,大部分AI天气预报模型仍基于ERA5训练和评估。天气预报此时可视为一个典型的机器学习竞技场——在一个标准数据集上做标准评估,以竞争名次。由于AI预报水平表面上已普遍超越数值模式,在这条路上“卷”下去的收益已陷入边际效应递减。

为了冲击下一个头条,亟需开辟新的赛道。除概率预报、区域高分辨率、物理驱动等优化方向,另一个思路是,找一找天气预报中还有什么重大环节是仍依赖传统方法的。同化?就是它了!

更好地利用观测

我们在系列上一篇中介绍了同化的概念和意义。用AI来做这件事有什么可能的好处?ECMWF今年的一篇Newsletter[1]解释得非常到位。这里浓缩转述。

同化极具挑战性:

  • 观测数据的空间尺度和结构与模式网格不同,需要融合。
  • 观测数据大部分情况下并非直接测量模式变量(如卫星可能提供的是辐射),需要映射。
  • 在融合和映射的过程中,需要精确定量观测和模式中的不确定性。

因此,带来数个问题:

  • 同化过程存在很大误差。
  • 部分数据无法纳入同化框架内。
  • 占用大量计算资源,或者说,大大延迟了最新观测融入预报的时间。

由于AI可以通过大量数据自主学习融合方式或映射关系,且速度显然远超4D-Var,确实有希望改进这些问题。

WHAT:端到端的不同理解

ECMWF去年的一篇Newsletter[2]总结了不同范式的AI预报模型。

223808559a9f7b.png

方式1代表目前最常见的AI模型。方式2代表用观测数据微调或评估AI模型。微软发布的Aurora模型[3]就针对站点观测进行了评估。微软还发布了基于临场观测(包括站点和用户数据)的Benchmark——WeatherReal[4]。

这里,我们重点看方式3-5。

基于AI的数据同化

为了用AI驱动整个天气预报流程,本着哪里不会点哪里的心态,研发独立的模块来代替传统数据同化,与AI预报配合,是最常见的做法之一,也即前文的方式3。例如:

  • 系列上一篇介绍的Fengwu-4DVar和Fengwu-Adas;
  • Fuxi的系列工作,如Fuxi-DA[5];
  • 基于扩散模型的DiffDA[6];
  • 微软和清华近期的合作ADAF[7]也类似,但关注区域近地面要素的同化。

这些工作不约而同选择了传统形式,即通过AI来融合背景场(即过去的预报场)和最新观测来实现同化。

223808c2ebe754.png

如此,为传统天气预报中两大关键部件——同化和预报,建立基于AI的同位替代,达成最直接的端到端效果。

端到端——AI同化+预报套餐

既然AI可以用于数据同化,那自然可以和预报模型打包形成一套端到端的解决方案。该方向近期最有影响力的工作是发表在Nature正刊上的Aardvark。

Aardvark的设计非常……朴素。模型分为三个部分:

  • Encoder将观测同化为初始分析场,训练目标是同时刻的ERA5,对应上文方式3。为了处理不规则分布的观测,使用了SetConv技术(原理不再赘述)。
  • Processor接在Encoder后负责预报,本质上是另一个Pangu、GraphCast,训练目标是下一时刻的ERA5,对应上文方式1。
  • Decoder每个时间步分别训练,负责将Processor的预报后处理到站点上,训练目标设为站点观测,对应上文方式2。

为了让这套其实是低配AI同化(有限的观测)+低配AI预报(分辨率为1.5°,24小时)+低配AI后处理(每个Decoder200万参数,30分钟训练完成)的模型拼盘发挥端到端的优势,训练阶段包含将三个部分联合微调的步骤。

2238099abffc55.png

尽管如此,仍推荐读一读这篇论文。技术和配置对于Nature也许并不关键,重要的是,如何讲好一个故事:用AI代替整个天气预报流程,速度更快,成本更低,部署更方便,优化更容易。用户可以用它来代替数值模式(因为它代替了整个预报系统),可以根据自己的需求微调(因为它支持在散点观测上微调)。当每个简陋的模块都能在这个故事背景里找到自己的价值,它就成了一篇Nature。

微软近期推出的区域端到端模型OMG-HD[8]与此有一定相似性。

总之,这里的端到端是指仅利用原始观测提供格点化预报,搭建的AI模型在“同化+预报”的框架内利用(再)分析数据的知识训练,并在运行时只依赖原始观测。可以认为他们实现了方式4,但本质是方式3(AI同化)和1(AI预报)的组合。至少,这种方法的优势之一是节省了本来消耗在同化上的巨量时间,大大缩短了预报延迟。

22380920eaed0f.png

其他相关工作还有潘宝祥老师团队的成果[9,10],有别于以上工作,需要另文详解。

在观测空间直接预报

等一等,端到端到底是什么意思?

在深度学习领域,可能指用AI完成从原始数据到预报目标的整个流程,或不需要人为设计阶段目标并分步训练。以上模型不同程度地达成了这些目的。但更进一步,端到端也可以指:

  • 知识完全从数据中挖掘,不依赖任何人类经验。
  • 不对输入按人为理解做预处理或特征工程。

具体到端到端天气预报模型,应该做到以下两点:

  • 从训练阶段开始,不使用任何(再)分析数据。(再)分析数据来自数值模式,显然包含了人类经验(或物理知识)。正如我们之前的文章提过,Pangu、GraphCast既是预报模型,也是IFS模拟器。
  • 去除传统的同化步骤。这条要求不那么显性,需要梳理下逻辑。

回到开头我们提到的:同化表示将数据从观测空间转换到模式空间,这包括将观测信息融合到人为设置的空间格点上,并映射为模式中采用的物理变量。这本质上仍是按对大气系统的人为理解,将输入做了预处理。更重要的是,当AI模型中设置了同化模块时,它的训练目标该设定为什么呢——显然,一旦有了同化,(再)分析数据的使用几乎不可避免。

去除(再)分析数据和同化模块后,剩下的选择就是我们小节的标题了:在观测空间直接预报(Direct Observation Prediction,DOP),将模型的输入输出都设置为观测场,也即是上文的方式5。

22381070036cab.png

先将这个思路是否现实放到一边,看看这样做的优势。

  • 首先,省略了同化中模式和观测空间的融合和映射。我们也不再需要诸如观测算子、误差协方差甚至切线性和伴随模式等一系列精细化操作。
  • 模型可以从任意观测中学习,甚至包括数值模式中尚未使用的那些——如果训练以(再)分析为目标,那么在输入中增加数值模式里未同化的数据,其实际效果是可疑的。而DOP没有这个问题。
  • 同样,彻底摆脱了(再)分析数据的限制,DOP的理论上限将高于数值模式。例如一些次网格过程在数值模式中用参数化方式模拟,而DOP可以直接从观测空间中学习这些过程在更大尺度上的反馈结果。

更多讨论,仍请可以参见ECMWF的Newsletter[2]。

HOW:GraphDOP简介
DOP的结构

ECMWF对DOP的初步尝试已经形成一篇论文,称为GraphDOP[11]。

我在读博面试时,一位老师考过我:ECMWF最大的优势是什么?我胡诌了些什么已经记不清楚,但老师答了两个字:同化。这至少意味着ECMWF对原始观测数据的理解全球领先,也让ECMWF成为可能是最适合尝试DOP路线的团队。这里,我们不深入解释ECMWF是如何在GraphDOP中使用观测的(但强烈推荐阅读该论文),而是来看看模型的设计。

223810317772a2.png
  • 12小时窗口内不规则分布的各类观测传入图神经网络,编码到隐空间。当然,这一步也可以被视作同化,区别是:它并没有被转换到预先设计的模式空间;训练中也没有任何学习目标。
  • 格点化的隐空间以Transformer为骨干网络rollout到后续时次。即自回归的形式仍然存在,但在隐空间内进行。
  • 每个时次的隐空间通过图神经网络解码器解码回观测空间,并与对应时次的观测计算损失以优化模型。

简而言之,GraphDOP仍然采用类似GraphCast和AIFS的encoder-processor-decoder架构,区别是彻底移除了ERA5。

DOP的挑战

抛开ECMWF在观测数据上的功夫全球独家,其他团队很难追赶,DOP形式的模型仍存在很多挑战。去除再分析数据的桎梏是把双刃剑。一些原始观测的固有问题再次暴露出来。

例如,不同观测数据的时间跨度不一,GraphDOP的选择是用2004-2021年的数据训练。不同时期的观测差异也要求模型识别数据中的漂移。

由于缺乏格点化的信息,DOP的一大任务是空间泛化。无论是极轨卫星、静止卫星或散点观测,DOP需要将观测信息泛化到缺乏观测的区域,毕竟无论是预报员还是用户,都可能需要覆盖全球任意位置的天气预报。例如,200hPa风速的观测来自无线电探空仪(下图左),模型则支持输出全球格点化的风速(下图右)。

2238113e665d96.png

当然,稀疏观测的空间泛化显然不能仅靠单一变量,而需要学习不同观测间的联系,这需要理解物理。然而,观测空间中的变量归根结底并不是我们想要的(例如辐射不仅受温度影响),也不直接代表大气的动力学过程。这无疑给模型增加了负担,也要求对观测数据源的选择更加可靠。原来属于同化的部分工作,如模式空间与观测空间的转换,可能实际上隐式交给了模型自主学习。

与此相关的一项例证是,尽管对2米气温的同化并不是IFS的强项(直到去年2米气温才被同化到业务模式中),而GraphDOP直接同化了站点观测,但在72小时、120小时预报中,GraphDOP相比IFS并没有优势:

223811c1a7d65d.png

这与其他AI模型优势逐渐放大的特点相反。更麻烦的是,一些高阶变量压根没有直接观测,比如海冰密集度。这降低了模型和现有业务的匹配度。

最后,由于一切都在观测空间进行,传统同化中的“背景场”概念变得没有意义。但不能忽略的是,“背景场”除了提供密集的格点信息外,本身也是一种气候态约束。进一步,背景场本身是预报,实际上将同化窗口前的观测信息通过预报部分传递了下来,类似于深度学习中的循环神经网络(RNN),而GraphDOP显然做不到这一点。

结语

如果一定要给端到端找到一个本质原理,那可能是通过堆数据规模来放飞模型,提升其上限。传统数值预报虽然基于扎实的理论,但也包含经验和统计性质的成分,因而跷跷板现象——看似优化了某个组件,却拖累了整体性能——也并不稀奇。时空分辨率、物理一致性等限制也某种程度上制约了最终的表现。建立端到端的AI预报体系很大程度上规避了这些问题。

然而,现有的观测数据似乎又没有丰富到理想的量级以支撑纯粹的“自动驾驶”。因而在向前迈了一大步后,可能还得往回找补一些。例如,在GraphDOP中,作者可以一方面强调AI方法在卫星同化中的优势,即天然的“全天候同化”,而数值模式中云和降水区的微波观测不参与同化,或通过复杂的湿物理参数化方案和辐射传输模式来实现;另一方面,又在Discussion中反思未来可能需要通过增加晴空数据的权重,来优化预报。

另外,我们在大量AI模型实例中看到,与数值模式不同,AI模型的性能似乎并不显著依赖于其时空分辨率,这可能也是ECMWF敢于直接在原始观测编码成的隐空间上运行预报,甚至猜测映射到精细网格可能反而拖累了AI模型的原因。但从事实出发,在基于ERA5的AI模型可以轻易超越IFS的今天,DOP交出的答卷显然还不够令人满意。



回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright ©2011-2024 NTpcb.com All Right Reserved.  Powered by Discuz! (NTpcb)

本站信息均由会员发表,不代表NTpcb立场,如侵犯了您的权利请举报投诉

本站所有资料仅限参考学习交流,PCB原理图源码等所有资料不保证准确没问题,请不要用作生产。否则后果自负。

闽公网安备35062302000276号 | 闽ICP备2024076463号-1 | 论坛技术支持QQ群171867948 | 论坛问题,充值问题请联系QQ1308068381

平平安安
TOP
快速回复 返回顶部 返回列表