洪水模型每天都可能算偏,怎样用水位站让它边算边纠正?
- 洪水模型每天都可能算偏,怎样用水位站让它边算边纠正?
- 一、百年一遇洪水图为什么不能代替实时洪水图?
- 二、为什么论文强调“概率洪水图”?
- 三、卫星观测为什么没有成为主要实时数据源?
- 四、研究区为什么选择Hurricane Harvey?
- 五、LISFLOOD-FP在框架中负责什么?
- 六、论文具体考虑了哪些不确定性?
- 七、集合卡尔曼滤波可以怎样通俗理解?
- 八、这篇论文为什么叫“多变量同化”?
- 九、为什么每个同化周期要运行两次模型?
- 十、整个实验是怎样设置的?
- 十一、为什么先做“合成真值实验”?
- 十二、真实Harvey实验中,流量和水位改善了多少?
- 流量
- 水位
- 十三、为什么退水阶段改进更明显?
- 十四、概率洪水图最终提高了多少?
- AUC
- 低估指数UFI
- 高估指数OFI
- 十五、“实时”预报是否真的足够快?
- 十六、这篇论文真正的创新在哪里?
- 十七、哪些局限必须认真看待?
- 1. DEM过粗
- 2. 河道几何高度简化
- 3. 只有一个真实事件
- 4. 参考洪水图不是逐日真值
- 5. 每日同化仍可能太慢
- 论文信息
洪水模型每天都可能算偏,怎样用水位站让它边算边纠正?
一句话读懂这篇论文:
作者让100个存在不同边界流量、河道糙率、河床高程和初始水深的LISFLOOD-FP模型同时运行;每当新的流量和水位观测到达,就利用多变量集合卡尔曼滤波先更新河道参数,再更新水深状态,然后继续预测下一天的淹没概率。2017年Hurricane Harvey案例表明,这种连续纠偏使概率洪水图的AUC提高约5%,淹没范围低估减少约7个百分点。
传统洪水图通常给出一个确定结论:
- 这里会淹;
- 那里不会淹;
- 水深是1.2米;
- 洪水边界就在这条线上。
但真实洪水模拟存在大量不确定性:
- 上游流量不一定准确;
- 支流来水可能估计错误;
- 河床高程缺少实测;
- Manning糙率并不是固定真值;
- 初始河道水深可能已经偏离实际;
- 简化的水动力模型不能完整描述真实河流。
如果模型在第一天算偏,第二天仍使用错误状态继续往前推,误差可能不断积累。
2021年,Jafarzadegan、Abbaszadeh和Moradkhani在《Hydrology and Earth System Sciences》发表:
Sequential data assimilation for real-time probabilistic flood inundation mapping
论文提出一套“边模拟、边观测、边校正”的洪水预报框架:
模型不是校准一次后一直运行,而是在洪水过程中持续接收水位站和流量站数据,同时更新模型状态与参数。
论文研究的核心不是遥感洪水识别,而是:
- LISFLOOD-FP二维水动力模拟;
- 多变量集合卡尔曼滤波;
- 水深状态更新;
- 河道糙率和河床高程更新;
- 一天提前量的概率洪水淹没制图。
一、百年一遇洪水图为什么不能代替实时洪水图?
传统洪水风险图通常按照固定重现期制作:
- 100年一遇;
- 500年一遇;
- 某个设计流量情景。
这种图适合长期规划,却不一定能回答:
明天这场洪水会淹到哪里?
论文以Hurricane Harvey为例指出,FEMA的100年和500年洪水图分别只覆盖了Harris County实际淹没区域的大约三分之一和一半。
真实洪水具有具体的:
- 上游洪峰;
- 支流汇流;
- 初始河道状态;
- 边界条件;
- 洪峰传播过程。
因此,应急决策需要的是:
针对当前事件、随新观测持续更新的洪水图。
二、为什么论文强调“概率洪水图”?
确定性模拟只使用一套流量、糙率、河床和初始水深,但这些输入都可能有误差。
概率图更适合表达不确定性:
| 淹没概率 | 通俗含义 |
|---|---|
| 0.95 | 100个成员中约95个预测受淹 |
| 0.70 | 多数成员预测受淹,但仍有不确定性 |
| 0.50 | 结果高度不确定 |
| 0.10 | 只有少数极端成员预测受淹 |
论文的目标不是消除不确定性,而是:
让概率分布随着观测不断变得更准确、更可靠。
三、卫星观测为什么没有成为主要实时数据源?
论文讨论了SAR洪水范围、SWOT和由洪水边界反演水面高程,但作者认为,当时卫星资料存在两个现实限制:
- 洪水涨落很快,而有效卫星影像可能只有0—2景;
- 许多河流宽度小于100米,部分卫星水位产品难以直接适配水动力同化。
因此,论文选择更连续的:
- 水文站流量;
- 水文站水位。
这不意味着作者否定卫星数据。论文结论明确提出,未来可以联合同化站点观测和遥感数据。
四、研究区为什么选择Hurricane Harvey?
研究区位于美国Texas州San Jacinto流域中部。
| 项目 | 信息 |
|---|---|
| 流域面积 | 约10,400 km² |
| 模拟主河道长度 | 约106 km |
| 主河道 | 4条 |
| 支流 | 8条 |
| 平均坡度 | 约0.62% |
| DEM分辨率 | 120 m |
| 洪水事件 | 2017年Hurricane Harvey |
Hurricane Harvey于2017年8月25日登陆Texas,连续约6天产生极端降雨。
论文模拟时段为:
2017 年7月30日—9月12日 2017\text{年7月30日—9月12日}2017年7月30日—9月12日
共45天,整个7月用作预热。
五、LISFLOOD-FP在框架中负责什么?
LISFLOOD-FP通过连续方程和动量方程模拟:
- 流量;
- 水面高程;
- 水深;
- 洪水向洪泛区扩散;
- 洪峰沿河传播。
论文使用Subgrid Channel Solver。
研究采用120米DEM,但子网格河槽能够表达宽度小于网格的河流,从而降低100成员集合模拟的计算成本。
六、论文具体考虑了哪些不确定性?
论文同时处理四层不确定性:
| 类型 | 处理方式 |
|---|---|
| 边界流量 | 加入20%相对误差 |
| 初始水深 | 加入标准差1 m的扰动 |
| 河道糙率 | 从0—0.1均匀抽样 |
| 河床高程 | 从39—42 m抽样并形成统一河床偏移 |
边界条件包括4个上游流量、7个侧向流量和下游条件。
河床被简化成一个统一偏移参数,计算高效,但无法表达真实河槽的复杂空间变化。
七、集合卡尔曼滤波可以怎样通俗理解?
可以把100个模型成员看成100名预测员。
每名预测员使用略有不同的:
- 流量;
- 糙率;
- 河床;
- 初始水深。
当新水位和流量观测到达后,EnKF会计算:
哪些状态和参数变化,与观测误差之间具有统计相关性?
基本更新形式可以写成:
更新值 = 预测值 + K ( 观测值 − 模型预测值 ) 更新值=预测值+K(观测值-模型预测值)更新值=预测值+K(观测值−模型预测值)
其中K KK为Kalman增益。
Kalman增益决定:
- 观测可信时,模型应该改多少;
- 模型和观测相关性弱时,更新应该多谨慎;
- 哪些参数和空间状态应该被调整。
八、这篇论文为什么叫“多变量同化”?
论文同时同化:
- Gauge 1流量;
- Gauge 2流量;
- Gauge 2水位。
作者特别考虑两类相关性:
- 不同站点流量之间的空间相关;
- 同一站点流量与水位之间的相关。
因此,观测误差协方差矩阵不仅包含对角线方差,也保留非零交叉协方差。
论文的核心观点是:
把相关观测假定为完全独立,会浪费它们之间的水力联系。
不过,论文只考虑同期相关性,没有显式处理洪水从上游传播到下游的时间滞后。
九、为什么每个同化周期要运行两次模型?
论文采用状态—参数双重估计。
第一轮重点更新:
- 河道糙率;
- 河床高程。
第二轮重点更新:
- 水深状态。
这样可以同时纠正当前水量状态与长期参数偏差。
十、整个实验是怎样设置的?
| 项目 | 设置 |
|---|---|
| 集合成员数 | 100 |
| 模拟时间 | 45天 |
| 预热期 | 2017年7月 |
| 模型内部时间步 | 1秒 |
| Courant数 | 0.7 |
| 同化和输出尺度 | 日尺度 |
| 预报提前量 | 1天 |
| DEM | 120 m |
| 流量相对误差 | 20% |
| 初始水深标准差 | 1 m |
| 河道糙率范围 | 0—0.1 |
| 河床高程范围 | 39—42 m |
100个成员在100个CPU核心上并行运行。
需要区分:
- LISFLOOD-FP内部以1秒步长计算;
- 观测同化和产品更新按日进行。
十一、为什么先做“合成真值实验”?
真实洪水中,河床和最优糙率并不知道。
因此,作者先做孪生实验:
- 预设一套确定参数;
- 用模型生成流量和水位;
- 把输出当作虚拟观测;
- 从错误参数集合出发同化;
- 检查参数能否回到预设真值。
结果显示:
- 河床高程较快收敛;
- 糙率收敛更慢;
- 洪峰附近观测信息最强。
但生成真值和同化预测使用同一个模型,因此该实验主要验证算法实现和参数可识别性,不代表已经解决真实模型结构误差。
十二、真实Harvey实验中,流量和水位改善了多少?
论文重点分析一天提前量的Prior预测。
Prior虽然尚未使用当天新观测,但已继承前一天同化后的状态和参数。
流量
开放环洪峰高估约:
200 m 3 / s 200\ m^3/s200m3/s
EnKF Prior的洪峰误差降到50立方米每秒以内。
| 结果 | RMSE | KGE | Reliability |
|---|---|---|---|
| Prior | 40.9 m³/s | 0.76 | 0.72 |
| Posterior | 29.1 m³/s | 0.84 | 0.75 |
水位
开放环在洪峰低估约2米。
| 结果 | RMSE | KGE | Reliability |
|---|---|---|---|
| Prior | 0.5 m | 0.96 | 0.71 |
| Posterior | 0.2 m | 0.98 | 0.71 |
Posterior使用当前观测,因此不能用0.2米RMSE代表一天提前量;一天预报对应的Prior RMSE是0.5米。
十三、为什么退水阶段改进更明显?
论文图6和图7分别展示涨水期与退水期。
开放环在退水阶段出现:
- 洪水斑块快速消失;
- 空间结果离散破碎;
- 水位过程偏窄;
- 退水时间错位。
EnKF则:
- 拓宽水位过程;
- 减少时间滞后;
- 让淹没概率逐步下降;
- 保持洪水空间形状更连续。
这说明连续同化不仅修正洪峰,也修正:
洪水持续时间和退水速度。
对农业洪灾而言,这一点非常重要,因为峰值范围决定最大暴露,而退水速度会影响作物受淹时长、土壤缺氧和灾后返盐风险。
十四、概率洪水图最终提高了多少?
作者将整个Harvey期间的概率淹没图取时间并集,与灾后参考范围比较。
AUC
EnKF比开放环提高约:
5 % 5\%5%
低估指数UFI
开放环:
30.3 % 30.3\%30.3%
EnKF:
23.4 % 23.4\%23.4%
低估减少:
30.3 − 23.4 = 6.9 30.3-23.4=6.930.3−23.4=6.9
个百分点,论文概括为约7%。
高估指数OFI
开放环为0.26%,EnKF为0.40%,两者均低于1%。
这说明模型的主要问题不是大面积高估,而是漏掉实际受淹区域。
最优Fit指数仍低于80%,120米DEM和简化河道设置是重要原因。
十五、“实时”预报是否真的足够快?
论文使用:
- 100个集合成员;
- 100个CPU核心;
- 120米DEM;
- Subgrid Solver。
一次Harvey概率模拟大约需要:
- 水动力计算约4小时;
- 数据同化约20分钟;
- 总计约4—5小时。
因此,论文中的“实时”更准确地理解为:
能够在洪水到达前几个小时完成下一天概率图更新。
它不是:
- 秒级实时;
- 单台普通电脑运行;
- 每小时滚动更新;
- 全国范围即时产品。
十六、这篇论文真正的创新在哪里?
- 将EnKF用于事件级概率淹没制图,而不仅是水位或流量预报;
- 同时更新状态和参数,联合估计水深、河道糙率和河床高程;
- 同时同化流量和水位,而不是只使用一种观测;
- 考虑站间和变量间相关性,在协方差矩阵中保留非零交叉项;
- 同时处理多层不确定性,包括边界流量、初始状态和模型参数;
- 既做合成实验,也验证真实极端洪水;
- 同时评价精度、概率可靠性和计算效率,包括RMSE、KGE、NRR、Reliability、AUC、Fit、UFI和OFI。
十七、哪些局限必须认真看待?
1. DEM过粗
120米DEM难以表示:
- 城市道路;
- 堤防;
- 小河道;
- 局地洼地;
- 精细河床。
2. 河道几何高度简化
模型假设矩形断面、统一河床偏移和统一糙率,真实河道空间变化远比这复杂。
3. 只有一个真实事件
Harvey是一场极端洪水,结果未证明在中小洪水、山区河流、冰雪融水洪水或水库调度洪水中具有相同性能。
4. 参考洪水图不是逐日真值
空间验证主要使用整个洪水期间的最大范围并集,无法完整检验每天的洪水边界和水深。
5. 每日同化仍可能太慢
对于数小时内快速涨落的城市洪水,一天更新一次可能不足。
它没有证明:
少量站点观测可以完全恢复真实二维洪水场。
它真正证明的是:
即使使用较粗DEM和简化河道,通过连续同化相关的流量与水位观测,仍能不断纠正状态和参数,使下一天的概率洪水图比不更新的开放环模拟更准确、更连续。
论文信息
论文题目:Sequential data assimilation for real-time probabilistic flood inundation mapping
作者:Keighobad Jafarzadegan、Peyman Abbaszadeh、Hamid Moradkhani
期刊:Hydrology and Earth System Sciences
卷与页码:25,4995—5011
发表年份:2021
DOI:10.5194/hess-25-4995-2021
Download:https://hess.copernicus.org/articles/25/4995/2021/