1.一种储能参与调频辅助服务优化的控制方法,其特征在于,包括:获得调频市场的历史调频信号数据,其中,所述历史调频信号数据包括训练数据集和测试数据集;建立秒级时序上的储能充放电模型,构建基于深度强化学习算法的储能参与调频辅助服务模型;其中,建立秒级时序上的储能充放电模型,具体包括:建立储能电量的动态方程、储能充放电功率约束条件、荷电状态约束条件以及最大充放电功率与荷电状态的约束条件;根据所述储能电量的动态方程、储能充放电功率约束条件、荷电状态约束条件、最大充放电功率与荷电状态的约束条件以及预设的储能状态定义公式;其中,储能电量的动态方程为: ;式中, 为储能电池在t时刻的电量, 与 分别为储能的充电和放电功率,且 , ; 与 分别为储能的充放电效率, 为时间间隔,按照调频信号的更新周期,取 ;储能充放电功率约束条件为: ;其中, 是储能电池t时刻的荷电状态, 和 为单个电池的最大放电功率和最大充电功率限制,是 的函数, 是单个电池的最大电量, 为储能运营商的电池数量; 限定了储能不能同时充电和放电;所述荷电状态约束条件为: ;其中, 和 是储能荷电状态的最小和最大值约束,在0到100%之间;所述最大充放电功率与荷电状态的约束条件为: ; ;所述储能状态定义公式为: ;其中,n为一个调度周期的指令数;其中,当储能参与调频辅助服务时,定义储能在t时刻的状态为 ;根据储能的当前状态、当前动作、当前动作的即时收益、下个时刻的状态以及调度周期结束标志建立深度强化学习的经验回放池;根据所述训练数据集和所述经验回放池训练所述储能参与调频辅助服务模型;根据所述测试数据集检测训练完毕的所述储能参与调频辅助服务模型;根据所述储能参与调频辅助服务模型对所述储能充放电模型进行优化,以对储能进行优化控制。
2.根据权利要求1所述的储能参与调频辅助服务优化的控制方法,其特征在于,所述深度强化学习算法包括深度确定性策略梯度(DDPG)算法。
3.根据权利要求2所述的储能参与调频辅助服务优化的控制方法,其特征在于,所述构建基于深度强化学习的储能参与调频辅助服务模型,包括:构建深度确定性策略梯度神经网络;随机初始化所述神经网络的权重参数 、权重参数 ,并令 , ,以初始化Critic网络 、Actor网络 、目标Critic网络 和目标Actor网络 ,其中 、 、 、 分别为每个神经网络的所述权重参数, 代表所述储能的当前状态, 代表状态 下选择动作 的价值, 代表状态 下的最优动作。
4.根据权利要求1所述的储能参与调频辅助服务优化的控制方法,其特征在于,所述经验回放池包括五元组元素,所述五元组元素为 ,其中, 代表所述储能的当前状态、 代表所述储能的当前动作、 代表所述储能当前动作的即时收益、 代表所述储能的下个时刻的状态、 代表调度周期结束标志,当 代表一个调度周期的结束,反之则 。
5.根据权利要求4所述的储能参与调频辅助服务优化的控制方法,其特征在于,所述构建基于深度强化学习的储能参与调频辅助服务模型之前,还包括:建立秒级时序上的调频绩效收益模型。
6.根据权利要求5所述的储能参与调频辅助服务优化的控制方法,其特征在于,根据所述调频绩效收益模型获得所述储能当前动作的即时收益 ,根据所述秒级时序上的储能充放电模型获得所述储能的下个时刻的状态 。
7.根据权利要求3所述的储能参与调频辅助服务优化的控制方法,其特征在于,根据Actor网络选择所述储能的当前动作 ,公式如下:其中, 是随机变量。
8.根据权利要求7所述的储能参与调频辅助服务优化的控制方法,其特征在于,所述根据所述训练数据集和所述经验回放池训练所述储能参与调频辅助服务模型,包括:从所述经验回放池中随机抽取N个五元组元素 ,作为一次训练的批量,其中N取100以内整数;根据损失函数和随机梯度下降法更新Critic网络 中所述权重参数 ,公式如下:其中,y i 为Critic网络训练的目标值,公式如下:其中, 为折现率;根据梯度下降方法更新Actor网络 的所述权重参数 ,公式如下:其中,J代表当前状态下,选择动作R的期望收益值,R代表动作值变量,公式如下:根据权重参数 和权重参数 分别更新目标Critic网络 中权重参数 和目标Actor网络 中权重参数 ,公式如下:其中 为软更新系数;判断所述权重参数 、所述权重参数 、所述权重参数 和所述权重参数 是否收敛,若否,则继续更新所述权重参数 、所述权重参数 、所述权重参数 和所述权重参数 ,直至所述权重参数 、所述权重参数 、所述权重参数 和所述权重参数 收敛。
9.一种储能参与调频辅助服务优化的控制系统,其特征在于,包括:数据集分配模块,用于将调频市场的历史调频信号数据分为训练数据集和测试数据集;模型构建模块,用于建立秒级时序上的储能充放电模型,构建基于深度强化学习算法的储能参与调频辅助服务模型;其中,建立秒级时序上的储能充放电模型,具体包括:建立储能电量的动态方程、储能充放电功率约束条件、荷电状态约束条件以及最大充放电功率与荷电状态的约束条件;根据所述储能电量的动态方程、储能充放电功率约束条件、荷电状态约束条件、最大充放电功率与荷电状态的约束条件以及预设的储能状态定义公式;其中,储能电量的动态方程为: ;式中, 为储能电池在t时刻的电量, 与 分别为储能的充电和放电功率,且 , ; 与 分别为储能的充放电效率, 为时间间隔,按照调频信号的更新周期,取 ;储能充放电功率约束条件为: ;其中, 是储能电池t时刻的荷电状态, 和 为单个电池的最大放电功率和最大充电功率限制,是 的函数, 是单个电池的最大电量, 为储能运营商的电池数量; 限定了储能不能同时充电和放电;所述荷电状态约束条件为: ;其中, 和 是储能荷电状态的最小和最大值约束,在0到100%之间;所述最大充放电功率与荷电状态的约束条件为: ; ;所述储能状态定义公式为: ;其中,n为一个调度周期的指令数;其中,当储能参与调频辅助服务时,定义储能在t时刻的状态为 ;经验回放池建立模块,用于根据储能的当前状态、当前动作、当前动作的即时收益、下个时刻的状态以及调度周期结束标志建立深度强化学习的经验回放池;模型训练模块,用于根据所述训练数据集和所述经验回放池训练所述储能参与调频辅助服务模型;模型检测模块,用于根据所述测试数据集检测训练完毕的所述储能参与调频辅助服务模型;所述控制系统还用于根据所述储能参与调频辅助服务模型对所述储能充放电模型进行优化,以对储能进行优化控制。
10.一种计算机终端设备,其特征在于,包括:一个或多个处理器;存储器,与所述处理器耦接,用于存储一个或多个程序;当所述一个或多个程序被所述一个或多个处理器执行,使得所述一个或多个处理器实现如权利要求1至7任一项所述的储能参与调频辅助服务优化的控制方法。