1.一种用于铁路车站的能源调度方法,其特征在于,所述方法适用于多源互补电力系统,所述多源互补电力系统包括并网互联的多种发电设备、储能设备和负载设备,该方法包括以下步骤:构建状态空间,所述状态空间包括目标铁路车站的环境参数、电价状态参数、能源设备状态参数和用户行为参数;所述环境参数包括外部自然环境参数以及铁路车站内部温湿度参数;所述电价状态参数包括电力采购和售卖价格;所述能源设备状态参数包括多类型发电设备的当前发电量和预计发电量、储能设备剩余电量和充放电状态、负载设备能源需求量、设备健康状态参数以及碳排放量;所述用户行为参数包括用电量需求参数、室内温湿度需求参数、设备使用偏好参数、成本敏感度参数、环保偏好参数以及用户满意度反馈参数;构建动作空间,所述动作空间包括对多类型发电设备控制参数、储能设备控制参数、电力买卖控制参数以及负载设备控制参数;基于深度强化学习,构建包含主策略网络和主估值网络的主网络,所述主策略网络以当前时刻所述状态空间的参数为输入并输出在所述动作空间中选择的控制动作;结合成本节省量、能量利用效率、用户满意度、设备磨损程度和环境影响程度计算奖励值,根据所述奖励值建立基于状态所选择动作的价值函数,所述主估值网络拟合所述价值函数得到主Q值;构建经验回放缓存区存放每次交互产生的数据用于随机采样训练更新所述主网络;其中,引入与所述主策略网络和所述主估值网络相同结构的目标网络,将所述目标网络拟合所述价值函数得到的目标Q值和所述主Q值计算均方误差作为损失函数,最小化损失函数更新所述主网络的参数,并周期性地将所述主网络的参数复制到所述目标网络;执行所述主网络选择的控制动作实现目标铁路车站的能源调度,并持续更新优化所述主网络。
2.根据权利要求1所述用于铁路车站的能源调度方法,其特征在于,所述外部自然环境参数包括所述目标铁路车站所处区域的气象信息、地质信息、时间信息;所述气象信息包括光照强度、风速、温度和湿度;所述时间信息包括日期、季节和当前时间;所述发电设备包括:光伏板、风力发电机和热电联产子系统;所述设备使用偏好参数通过标记用户选择运行的负载、负载设备使用频率以及负载运行时长进行量化;所述用户满意度反馈参数包括用户通过预设链路反馈的满意度评分、量化的调节意见、所述负载设备使用频率和所述负载设备的推荐指数;所述发电设备控制参数包括对所述发电设备的启停控制参数和运行功率控制参数;所述储能设备控制参数包括对多台所述储能设备的调度参数以及充放电功率控制参数;所述电力买卖控制参数包括对所述发电设备的产出电量和所述储能设备中存储电量的出售调度参数,以及外部电能采购控制参数;所述负载设备控制参数包括对各所述负载设备的启停控制参数和运行状态控制参数;所述预计发电量通过ANN神经网络进行预测。
3.根据权利要求2所述用于铁路车站的能源调度方法,其特征在于,所述主策略网络和所述主估值网络采用全连接网络、卷积神经网络或循环神经网络,并引入ReLU或sigmoid激活函数。
4.根据权利要求3所述用于铁路车站的能源调度方法,其特征在于,结合成本节省量、能量利用效率、用户满意度、设备磨损程度和环境影响程度计算奖励值,包括:计算所述多源互补电力系统的采购成本,计算式为:R cost_saving =-(Price purchased ×Power purchased );其中,R cost_saving 表示所述采购成本,Price purchased 表示采购电价,Power purchased 表示采购电量;计算所述多源互补电力系统的销售收益,计算式为:R sales_gain =Price sold ×Power sold ;其中,R sales_gain 表示所述销售收益,Price sold 表示销售电价,Power sold 表示售出电量;获取所述多源互补电力系统的各时刻的能源利用率,并计算当前时刻的能源利用率变化量,计算式为:R efficiency =Efficiency current -Efficiency previous ;其中,R efficiency 表示所述能源利用率变化量,Efficiency current 表示当前能源利用率,Efficiency previous 表示上一时刻能源利用率;获取所述多源互补电力系统在各时刻的健康状态以表征所述设备磨损程度,计算当前时刻的系统健康状态变化量,计算式为:R health =Health current -Health previous ;其中,R health 表示所述系统健康状态变化量,Health current 表示当前时刻所述多源互补电力系统的健康状态,Health previous 表示上一时刻所述多源互补电力系统的健康状态;所述健康状态采用各设备的剩余使用寿命或故障率进行标定;计算所述奖励值,计算式为:R t =ω 1 (R cost_savin g +R sales_gain )+ω 2 ·R efficiency +ω 3 ·R satisfacti on +ω 4 ·R halth +ω 5 ·R environmen tal ;R environmen tal =-Emissions current ;其中,R t 表示t时刻的所述奖励值,R satisfacti on 为量化的所述满意度评分,R environmen tal 为环境影响值,Emissions current 为所述多源互补电力系统的碳排放量,ω 1 、ω 2 、ω 3 、ω 4 和ω 5 为权重系数。
5.根据权利要求4所述用于铁路车站的能源调度方法,其特征在于,所述主估值网络拟合所述价值函数得到主Q值,表达式为:Q(s,a,θ)=E[R t +γmax a′ Q(s′,a′,θ)∣s,a];其中,Q(s,a,θ)表示所述主Q值,E表示期望,R t 表示t时刻的所述奖励值,s表示t时刻的状态,a表示t时刻选择的动作,s′表示t+1时刻状态,a′在状态s′能获得最大价值函数值的动作,γ表示衰减因子;θ为所述主估值网络的参数;所述目标网络拟合所述价值函数得到的目标Q值,表达式为:y=R t +γmax a′ Q target (s′,a′,θ′);其中,y表示所述目标Q值,R t 表示t时刻的所述奖励值,s表示t时刻的状态,a表示t时刻选择的动作,s′表示t+1时刻状态,a′在状态s′能获得最大价值函数值的动作,γ表示衰减因子;θ′为所述目标网络的参数。
6.根据权利要求5所述用于铁路车站的能源调度方法,其特征在于,所述损失函数的表达式为:L(θ)=E[(y-Q(s,a,θ)) 2 ]其中,L(θ)表示所述损失函数,E表示期望,y表示所述目标Q值,Q(s,a,θ)表示所述主Q值。
7.根据权利要求6所述用于铁路车站的能源调度方法,其特征在于,所述主策略网络和所述主估值网络基于历史数据所构建的历史状态空间和历史动作空间进行预训练,并迁移至所述多源互补电力系统运行和持续更新。
8.一种适用于铁路车站的多源互补电力系统,其特征在于,所述系统包括:多源发电子系统,包括光伏板、风力发电机和热电联产子系统,所述多源发电子系统与外部电网并网连接;储能设备子系统,连接所述多源发电子系统以及所述外部电网;多个负载设备,连接所述多源发电子系统、所述储能设备子系统和所述外部电网;设备管理子系统,用于执行如权利要求1至7任意一项所述用于铁路车站的能源调度方法,根据环境参数、电价状态参数、能源设备状态参数和用户行为参数,选择并执行控制动作,实现目标铁路车站的能源调度;所述环境参数包括外部自然环境参数以及铁路车站内部温湿度参数;所述电价状态参数包括电力采购和售卖价格;所述能源设备状态参数包括多类型发电设备的当前发电量和预计发电量、储能设备剩余电量和充放电状态、负载设备能源需求量、设备健康状态参数以及碳排放量;所述用户行为参数包括用电量需求参数、室内温湿度需求参数、设备使用偏好参数、成本敏感度参数、环保偏好参数以及用户满意度反馈参数。
9.一种计算机可读存储介质,其上存储有计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时实现如权利要求1至7中任一项所述方法的步骤。
10.一种计算机程序产品,包括计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时实现权利要求1至7中任一项所述方法的步骤。