1.一种用于调整电力系统潮流收敛的方法,所述方法包括:获取电力系统历史基态负荷状态,根据历史基态负荷状态的负荷水平和系统中可调电气元件,确定状态空间和动作空间,并根据状态空间和动作空间确定Q神经网络模型的输入和输出维度,其中所述动作空间,包括电力系统中全部可调的发电机的起停机状态,其中使用0-1变量来表示电力系统发电机起停机状态,0表示发电机停机,1表示发电机投运;确定动作空间与电力系统发电机的起停机状态的映射关系,根据训练模型输出的调整动作调整电力系统发电机运行状态;以目标负荷水平和电力系统发电机起停机状态作为输入,调整动作作为输出,根据输入和输出维度训练Q神经网络模型;获取目标负荷水平及发电机的当前起停机状态,根据Q神经网络模型确定调整动作,根据调整动作调整电力系统潮流至收敛状态,其中所述训练Q神经网络模型,具体包括:初始化当前Q网络并随机初始化当前Q网络的权重参数;初始化目标Q网络,并将当前Q网络的权重参数赋值给目标Q网络;所述当前Q网络和目标Q网络结构相同;初始化回放记忆单元,存储训练过程中产生的经验元组,所述经验元组为系统状态转移、调整动作和即时奖励;当所述经验元组存满后,回放记忆单元对最早存储的经验元组进行剔除;向当前Q网络输入目标负荷水平和电力系统发电机起停机状态;当前Q网络根据目标负荷水平和电力系统发电机起停机状态,输出调整动作;以预设概率执行调整动作,所述调整动作为反转可调整的发电机的运行状态;确定调整动作的奖励值,获取电力系统的下一个运行状态,并将下一个运行状态运的转移过程、即时奖励和调整动作作为一条经验元组存储至回放记忆单元;在回放记忆单元中随机抽取多条经验并计算每一条经验的累积奖励的预测偏差,根据预测偏差的总和按梯度下降方向更新当前Q网络的权重参数,并以预设频率将当前Q网络的权重参数复制到目标Q网络中;对目标Q网络进行预设回合的训练,直至平均累积奖励值达到较高的水平且保持稳定后,生成Q神经网络模型,其中奖励值的奖励函数如下:
2.根据权利要求1所述的方法,所述基态负荷状态,包括负荷有功功率值和无功功率值。
3.根据权利要求1所述的方法,所述状态空间,包括电力系统发电机的起停机状态和电力系统的负荷状态。
4.一种用于调整电力系统潮流收敛的系统,所述系统包括:采集模块,获取电力系统历史基态负荷状态,根据历史基态负荷状态的负荷水平和系统中可调电气元件,确定状态空间和动作空间,并根据状态空间和动作空间确定Q神经网络模型的输入和输出维度,其中所述动作空间,包括电力系统中全部可调的发电机的起停机状态,其中使用0-1变量来表示电力系统发电机起停机状态,0表示发电机停机,1表示发电机投运;处理模块,确定动作空间与电力系统发电机的起停机状态的映射关系,根据训练模型输出的调整动作调整电力系统发电机运行状态;训练模块,以目标负荷水平和电力系统发电机起停机状态作为输入,调整动作作为输出,根据输入和输出维度训练Q神经网络模型;调整模块,获取目标负荷水平及发电机的当前起停机状态,根据Q神经网络模型确定调整动作,根据调整动作调整电力系统潮流至收敛状态,其中所述训练Q神经网络模型,具体包括:初始化当前Q网络并随机初始化当前Q网络的权重参数;初始化目标Q网络,并将当前Q网络的权重参数赋值给目标Q网络;所述当前Q网络和目标Q网络结构相同;初始化回放记忆单元,存储训练过程中产生的经验元组,所述经验元组为系统状态转移、调整动作和即时奖励;当所述经验元组存满后,回放记忆单元对最早存储的经验元组进行剔除;向当前Q网络输入目标负荷水平和电力系统发电机起停机状态;当前Q网络根据目标负荷水平和电力系统发电机起停机状态,输出调整动作;以预设概率执行调整动作,所述调整动作为反转可调整的发电机的运行状态;确定调整动作的奖励值,获取电力系统的下一个运行状态,并将下一个运行状态运的转移过程、即时奖励和调整动作作为一条经验元组存储至回放记忆单元;在回放记忆单元中随机抽取多条经验并计算每一条经验的累积奖励的预测偏差,根据预测偏差的总和按梯度下降方向更新当前Q网络的权重参数,并以预设频率将当前Q网络的权重参数复制到目标Q网络中;对目标Q网络进行预设回合的训练,直至平均累积奖励值达到较高的水平且保持稳定后,生成Q神经网络模型,其中奖励值的奖励函数如下:
5.根据权利要求4所述的系统,所述基态负荷状态,包括负荷有功功率值和无功功率值。
6.根据权利要求4所述的系统,所述状态空间,包括电力系统发电机的起停机状态和电力系统的负荷状态。