1.一种风电储能站实时调控方法,其特征在于,包括以下步骤:构建风电储能站的在线运行模型;基于Lyapunov优化方法对在线运行模型进行优化,获取基础在线调度策略;采用基础在线调度策略对风电储能站进行调度,获取基础运行数据;基于DDPG强化学习算法构建风电储能站的进阶调度模型,包括Actor网络、Critic网络、Actor目标网络和Critic目标网络,其中:所述Actor网络用于生成决策策略,即输入状态后会输出相应的动作,并生成Actor目标网络更新参数;所述Critic网络用于对决策策略进行评估,即输入状态和动作后会输出相应的评分,并生成Critic目标网络更新参数;所述Actor目标网络用于基于Actor目标网络更新参数及输入的状态生成模拟真实决策策略;所述Critic网络用于基于Critic目标网络更新参数及输入的状态、模拟真实决策策略进行评估,生成模拟真实评分;其中,在所述风电储能站的进阶调度模型中,所述状态包括储能电量、最大出力和实时电价,所述动作包括储能充电的功率、直接输给受端电网的功率和储能站输向受端电网的功率;所述评分为储能充放电动作带来的长期收益;所述模拟真实评分为模拟储能充放电动作带来的真实长期收益;根据基础运行数据对进阶调度模型进行训练,直至进阶调度模型符合预设的评估标准,获取进阶在线调度策略;具体为:所述基础运行数据为数据四元组,包括状态、动作、奖励和下一时刻的状态;基于基础运行数据采用反向传播算法对Actor网络、Critic网络进行训练,不断更新网络参数,获取当前调度策略;其中:Actor网络的训练目标为最大化储能充放电动作带来的长期收益;Critic网络的目标为训练最小化储能长期收益与模拟真实的储能长期收益之间的误差;根据风电储能站在当前调度策略下的收益与在基础在线调度策略下的收益情况进行判断;若满足预设的评估标准,则将当前调度策略作为进阶在线调度策略;否则,继续对Actor网络、Critic网络进行训练;采用进阶在线调度策略对风电储能站进行调控。
2.根据权利要求1所述的一种风电储能站实时调控方法,其特征在于,所述基于Lyapunov优化方法对在线运行模型进行优化,获取基础在线调度策略,具体为:基于Lyapunov优化方法将时刻t的在线运行模型优化建模为Lyapunov优化问题:式中:τ表示每次决策的时间间隔;Q t 为基于储能电量构建的虚拟队列,有Q t =E t -η,E t 表示时刻t的储能电量,η为常量;P t ws 为用于储能充电的风电功率;P t wg 为直接输给受端电网的风电功率;V为常量;π t 表示实时电价;η d 为储能的放电效率;P t sg 为储能站输向受端电网的功率;η c 为储能的充电效率;P t w 表示时刻t的最大风电出力;T u 为传输线容量;P u 为储能的最大充放电功率;求解Lyapunov优化问题,获取基础在线调度策略。
3.根据权利要求1所述的一种风电储能站实时调控方法,其特征在于,所述采用基础在线调度策略对风电储能站进行调度,获取基础运行数据具体为:采用基础在线调度策略对风电储能站进行调度,获取各个时刻的状态量和决策量,得到一系列状态-动作数据;基于状态-动作数据计算对应的奖励,建立数据四元组作为基础运行数据。
4.一种风电储能站实时调控系统,其特征在于,包括在线运行模块、Lyapunov优化模块、基础调度模块、DDPG算法模块、训练评估模块和进阶调度模块;其中:所述在线运行模块用于构建风电储能站的在线运行模型;所述Lyapunov优化模块用于基于Lyapunov优化方法对在线运行模型进行优化,获取基础在线调度策略;所述基础调度模块用于采用基础在线调度策略对风电储能站进行调度,获取基础运行数据;所述DDPG算法模块用于基于DDPG强化学习算法构建风电储能站的进阶调度模型,包括Actor网络、Critic网络、Actor目标网络和Critic目标网络,其中:所述Actor网络用于生成决策策略,即输入状态后会输出相应的动作,并生成Actor目标网络更新参数;所述Critic网络用于对决策策略进行评估,即输入状态和动作后会输出相应的评分,并生成Critic目标网络更新参数;所述Actor目标网络用于基于Actor目标网络更新参数及输入的状态生成模拟真实决策策略;所述Critic网络用于基于Critic目标网络更新参数及输入的状态、模拟真实决策策略进行评估,生成模拟真实评分;其中,在所述风电储能站的进阶调度模型中,所述状态包括储能电量、最大出力和实时电价,所述动作包括储能充电的功率、直接输给受端电网的功率和储能站输向受端电网的功率;所述评分为储能充放电动作带来的长期收益;所述模拟真实评分为模拟储能充放电动作带来的真实长期收益;所述训练评估模块用于根据基础运行数据对进阶调度模型进行训练,直至进阶调度模型符合预设的评估标准,获取进阶在线调度策略;具体为:所述基础运行数据为数据四元组,包括状态、动作、奖励和下一时刻的状态;基于基础运行数据采用反向传播算法对Actor网络、Critic网络进行训练,不断更新网络参数,获取当前调度策略;其中:Actor网络的训练目标为最大化储能充放电动作带来的长期收益;Critic网络的目标为训练最小化储能长期收益与模拟真实的储能长期收益之间的误差;根据风电储能站在当前调度策略下的收益与在基础在线调度策略下的收益情况进行判断;若满足预设的评估标准,则将当前调度策略作为进阶在线调度策略;否则,继续对Actor网络、Critic网络进行训练;所述进阶调度模块用于采用进阶在线调度策略对风电储能站进行调控。
5.根据权利要求4所述的一种风电储能站实时调控系统,其特征在于,所述Lyapunov优化模块用于基于Lyapunov优化方法对在线运行模型进行优化,获取基础在线调度策略,具体为:基于Lyapunov优化方法将时刻t的在线运行模型优化建模为Lyapunov优化问题:式中:τ表示每次决策的时间间隔;Q t 为基于储能电量构建的虚拟队列,有Q t =E t -η,E t 表示时刻t的储能电量,η为常量;P t ws 为用于储能充电的风电功率;P t wg 为直接输给受端电网的风电功率;V为常量;π t 表示实时电价;η d 为储能的放电效率;P t sg 为储能站输向受端电网的功率;η c 为储能的充电效率;P t w 表示时刻t的最大风电出力;T u 为传输线容量;P u 为储能的最大充放电功率;求解Lyapunov优化问题,获取基础在线调度策略。
6.根据权利要求4所述的一种风电储能站实时调控系统,其特征在于,所述基础调度模块用于采用基础在线调度策略对风电储能站进行调度,获取基础运行数据,具体为:采用基础在线调度策略对风电储能站进行调度,获取各个时刻的状态量和决策量,得到一系列状态-动作数据;基于状态-动作数据计算对应的奖励,建立数据四元组作为基础运行数据。