1.一种基于深度强化学习的数值天气预报预测方法,其特征在于,所述方法包括:设置集合变分数据同化的自定义环境;获取策略网络参数和价值网络参数;根据所述集合变分数据同化的自定义环境、策略网络参数和价值网络参数基于深度强化学习方法,得到更新后的策略网络参数;根据所述更新后的策略网络参数,确定混合背景-误差协方差矩阵,所述混合背景-误差协方差矩阵为静态协方差矩阵和集合协方差矩阵的加权平均值;根据所述混合背景-误差协方差矩阵更新自适应混合参数策略模型训练,得到数值天气预报预测模型;根据所述数值天气预报预测模型进行数值天气预报预测;所述设置集合变分数据同化的自定义环境,具体包括:根据集合变分数据同化系统同化预报循环过程定制强化学习仿真环境,设计智能体的状态空间和动作空间,并建立决策-反馈的奖励机制,得到当前时刻的奖励函数;获取当前时刻的动作和状态;将所述奖励函数、动作和状态作为集合变分数据同化的自定义环境;所述根据所述集合变分数据同化的自定义环境、策略网络参数和价值网络参数基于深度强化学习方法,得到更新后的策略网络参数,具体包括:根据所述集合变分数据同化的自定义环境、策略网络参数和价值网络参数基于深度近端政策优化算法,得到更新后的策略网络参数;所述根据所述更新后的策略网络参数,确定混合背景-误差协方差矩阵,具体包括:根据所述更新后的策略网络参数采用公式B h =(1-β)B s +βB e ,确定混合背景-误差协方差矩阵;其中,B h 为混合背景-误差协方差矩阵,B e 为静态协方差矩阵,B s 为集合协方差矩阵,β为更新后的策略网络参数,控制着B e 和B s 的权重,0<β<1。
2.根据权利要求1所述的基于深度强化学习的数值天气预报预测方法,其特征在于,所述深度近端政策优化算法具体包括Actor网络和Critic网络,所述Actor网络负责生成动作,在混合同化过程中选择合适的参数比例;Critic网络则估计价值函数,用于评估当前策略的效果。
3.一种基于深度强化学习的数值天气预报预测的系统,其特征在于,所述系统包括:自定义环境设置模块,用于设置集合变分数据同化的自定义环境;参数获取模块,用于获取策略网络参数和价值网络参数;策略网络参数更新模块,用于根据所述集合变分数据同化的自定义环境、策略网络参数和价值网络参数基于深度强化学习方法,得到更新后的策略网络参数;混合背景-误差协方差矩阵确定模块,用于根据所述更新后的策略网络参数,确定混合背景-误差协方差矩阵,所述混合背景-误差协方差矩阵为静态协方差矩阵和集合协方差矩阵的加权平均值;数值天气预报预测模型训练模块,用于根据所述混合背景-误差协方差矩阵更新自适应混合参数策略模型训练,得到数值天气预报预测模型;数值天气预报预测模块,用于根据所述数值天气预报预测模型进行数值天气预报预测;所述自定义环境设置模块,具体包括:奖励函数确定单元,用于根据集合变分数据同化系统同化预报循环过程定制强化学习仿真环境,设计智能体的状态空间和动作空间,并建立决策-反馈的奖励机制,得到当前时刻的奖励函数;动作和状态确定单元,用于获取当前时刻的动作和状态;自定义环境确定单元,用于将所述奖励函数、动作和状态作为集合变分数据同化的自定义环境;所述策略网络参数更新模块,具体包括:策略网络参数更新单元,用于根据所述集合变分数据同化的自定义环境、策略网络参数和价值网络参数基于深度近端政策优化算法,得到更新后的策略网络参数;所述混合背景-误差协方差矩阵确定模块,具体包括:混合背景-误差协方差矩阵确定单元,用于根据所述更新后的策略网络参数采用公式B h =(1-β)B s +βB e ,确定混合背景-误差协方差矩阵;其中,B h 为混合背景-误差协方差矩阵,B e 为静态协方差矩阵,B s 为集合协方差矩阵,β为更新后的策略网络参数,控制着B e 和B s 的权重,0<β<1。
4.一种电子设备,其特征在于,所述电子设备包括存储器及处理器,所述存储器用于存储计算机程序,所述处理器运行计算机程序以使电子设备执行权利要求1-2任一项所述的基于深度强化学习的数值天气预报预测方法。
5.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机程序,所述计算机程序被处理器执行时实现权利要求1-2任一项所述的基于深度强化学习的数值天气预报预测方法。