1.一种基于强化学习理论的配电网开关自动控制方法,其特征在于,包括:步骤S1:建立Distflow潮流优化约束模型,并确定近似动态规划的强化学习算法;步骤S2:获取光伏、风电分布式发电单元的历史出力数据,并根据所述历史出力数据建立分布式发电单元输出功率波动及转化模型;步骤S3:确定配电网络拓扑结构,并获取分布式发电单元有功出力数据、配电网可控分段开关、联络开关状况信息和 Distflow潮流优化约束模型计算结果信息,以及根据所述分布式发电单元输出功率波动及转化模型、所述配电网络拓扑结构和步骤S3中获取的信息建立配电网络马尔可夫决策过程MDP模型;其中,步骤S3包括:步骤S31:将各分布式发电单元的输出功率波动状况量化值以及对应的配电网络拓扑结构建模为所述配电网络马尔可夫决策过程MDP模型的状态参量;步骤S32:将连接配电网络各条支线的开关的动作状态建模为所述配电网络马尔可夫决策过程MDP模型的动作组合参量;步骤S33:选择考虑分布式发电故障的所述Distflow潮流优化约束模型中的切负荷以及线路运营成本建模为所述配电网络马尔可夫决策过程MDP模型的奖励函数参考指标;步骤S34:定义所述配电网络马尔可夫决策过程MDP模型的状态转移概率,以便考虑各分布式发电单元发电功率输出水平的变化概率带来的不确定性;步骤S4:采用近似动态规划的所述强化学习算法求解所述配电网络马尔可夫决策过程MDP模型,并实时输出配电网开关自动控制最优策略。
2.如权利要求1所述的基于强化学习理论的配电网开关自动控制方法,其特征在于,所述步骤S1包括:步骤S11:根据配电网拓扑结构约束和配电网潮流计算基本理论建立所述Distflow潮流优化约束模型;步骤S12:根据强化学习理论和贝尔曼最优方程确定出近似动态规划的所述强化学习算法。
3.如权利要求1所述的基于强化学习理论的配电网开关自动控制方法,其特征在于,所述步骤S2中,在建立所述分布式发电单元输出功率波动及转化模型之前,所述方法还包括:对各分布式发电单元的输出功率波动和不确定状况进行分析和量化,以便将量化值作为所述配电网络马尔可夫决策过程MDP模型的输入。
4.如权利要求3所述的基于强化学习理论的配电网开关自动控制方法,其特征在于,通过所述分布式发电单元输出功率波动及转化模型能够模拟各分布式发电单元输出功率的波动性和不确定性。
5.如权利要求1所述的基于强化学习理论的配电网开关自动控制方法,其特征在于,所述步骤S4中,在实时输出所述配电网开关自动控制最优策略之前,所述方法还包括:对所述配电网络马尔可夫决策过程MDP模型进行离线迭代训练。
6.如权利要求5所述的基于强化学习理论的配电网开关自动控制方法,其特征在于,对所述配电网络马尔可夫决策过程MDP模型进行离线迭代训练的步骤包括:输入分布式发电单元有功出力数据,并输出配电网开关自动控制策略,以及反馈配电网络实时运行情况评价指标。
7.如权利要求1所述的基于强化学习理论的配电网开关自动控制方法,其特征在于,所述步骤S4中,在实时输出所述配电网开关自动控制最优策略之后,所述方法还包括:在人机交互界面进行决策结果文字显示和实时配电网网络拓扑结构显示。
8.如权利要求1所述的基于强化学习理论的配电网开关自动控制方法,其特征在于,所述开关的动作状态包括:开关变换当前时刻的开关状态和保持当前时刻的开关状态。
9.一种基于强化学习理论的配电网开关自动控制系统,其特征在于,包括:建立模块,用于建立Distflow潮流优化约束模型;确定模块,用于确定近似动态规划的强化学习算法;获取模块,用于获取光伏、风电分布式发电单元的历史出力数据,以便所述建立模块根据所述历史出力数据建立分布式发电单元输出功率波动及转化模型;所述建立模块还用于根据所述确定模块确定的配电网络拓扑结构、所述获取模块获取的分布式发电单元有功出力数据、配电网可控分段开关、联络开关状况信息和Distflow潮流优化约束模型计算结果信息,以及所述分布式发电单元输出功率波动及转化模型建立配电网络马尔可夫决策过程MDP模型,包括:将各分布式发电单元的输出功率波动状况量化值以及对应的配电网络拓扑结构建模为所述配电网络马尔可夫决策过程MDP模型的状态参量;将连接配电网络各条支线的开关的动作状态建模为所述配电网络马尔可夫决策过程MDP模型的动作组合参量;选择考虑分布式发电故障的所述Distflow潮流优化约束模型中的切负荷以及线路运营成本建模为所述配电网络马尔可夫决策过程MDP模型的奖励函数参考指标;定义所述配电网络马尔可夫决策过程MDP模型的状态转移概率,以便考虑各分布式发电单元发电功率输出水平的变化概率带来的不确定性;计算模块,用于根据近似动态规划的所述强化学习算法求解所述配电网络马尔可夫决策过程MDP模型,并实时输出配电网开关自动控制最优策略。