1.基于无模型强化学习的综合能源能量优化方法,其特征在于,包括:根据预置综合能源服务商模型获取供能指导信号样本,所述预置综合能源服务商模型为:其中,α为权重因子,λ(t)为供能指导信号, 和 分别为园区综合能源系统第t时间段与配网的能量交换量、在N T 时间内最大能量交换量和平均能量交换量,ε m 为换算因子,profit base 为配网综合能源服务商收益,N T 和N m 分别为总时间和园区综合能源子系统数量, 和 分别满足如下约束关系:将所述供能指导信号样本输入预置神经网络中,并根据预置损失函数进行网络训练,获取园区综合能源系统与配网的能量交换量,所述预置损失函数包括范数惩罚项;通过蒙特卡洛算法根据所述能量交换量进行奖励性模拟计算,获取最优供能指导信号;将所述最优供能指导信号代入预置能量优化模型中,求得最优调度方案,所述预置能量优化模型包括预置能量调度函数和预置约束条件。
2.根据权利要求1所述的基于无模型强化学习的综合能源能量优化方法,其特征在于,所述将所述供能指导信号样本输入预置神经网络中,并根据预置损失函数进行网络训练,获取园区综合能源系统与配网的能量交换量,之前还包括:将售价样本根据预置基准值转化为标幺值,得到供能指导信号;将所述供能指导信号进行归一化处理,得到所述供能指导信号样本。
3.根据权利要求1所述的基于无模型强化学习的综合能源能量优化方法,其特征在于,所述将所述供能指导信号样本输入预置神经网络中,并根据预置损失函数进行网络训练,获取园区综合能源系统与配网的能量交换量,包括:选取均方差函数作为所述预置神经网络的训练损失函数;在所述训练损失函数中添加根据正则化计算得到的所述范数惩罚项,得到所述预置损失函数;将所述供能指导信号样本输入预置神经网络中进行训练,获取园区综合能源系统与配网的所述能量交换量。
4.根据权利要求1所述的基于无模型强化学习的综合能源能量优化方法,其特征在于,所述通过蒙特卡洛算法根据所述能量交换量进行奖励性模拟计算,获取最优供能指导信号,包括:通过蒙特卡洛算法根据所述能量交换量、预置奖励权重和预置模拟次数进行奖励性模拟计算,获取最优供能指导信号。
5.基于无模型强化学习的综合能源能量优化装置,其特征在于,包括:获取模块,用于根据预置综合能源服务商模型获取供能指导信号样本,所述预置综合能源服务商模型为:其中,α为权重因子,λ(t)为供能指导信号, 和 分别为园区综合能源系统的第t时间段与配网的能量交换量、在N T 时间内最大能量交换量和平均能量交换量,ε m 为换算因子,profit base 为配网综合能源服务商收益,N T 和N m 分别为总时间和园区综合能源子系统数量, 和 分别满足如下约束关系:训练模块,用于将所述供能指导信号样本输入预置神经网络中,并根据预置损失函数进行网络训练,获取园区综合能源系统与配网的能量交换量,所述预置损失函数包括范数惩罚项;计算模块,用于通过蒙特卡洛算法根据所述能量交换量进行奖励性模拟计算,获取最优供能指导信号;优化求解模块,用于将所述最优供能指导信号代入预置能量优化模型中,求得最优调度方案,所述预置能量优化模型包括预置能量调度函数和预置约束条件。
6.根据权利要求5所述的基于无模型强化学习的综合能源能量优化装置,其特征在于,还包括:预处理模块,用于将售价样本根据预置基准值转化为标幺值,得到供能指导信号;将所述供能指导信号进行归一化处理,得到所述供能指导信号样本。
7.根据权利要求5所述的基于无模型强化学习的综合能源能量优化装置,其特征在于,所述训练模块具体用于:选取均方差函数作为所述预置神经网络的训练损失函数;在所述训练损失函数中添加根据正则化计算得到的所述范数惩罚项,得到所述预置损失函数;将所述供能指导信号样本输入预置神经网络中进行训练,获取园区综合能源系统与配网的所述能量交换量。
8.根据权利要求5所述的基于无模型强化学习的综合能源能量优化装置,其特征在于,所述计算模块具体用于:通过蒙特卡洛算法根据能量交换量、预置奖励权重和预置模拟次数进行奖励性模拟计算,获取最优供能指导信号。