1.一种面向智能电网的多目标优化调度系统,其特征在于,包括以下功能模块:调度目标组合模块,从调度目标集合S中选择调度目标组合S i ,调度目标组合S i 用于指导智能体Agent i 对环境状态的改变进行评估,根据评估值对动作进行优化;状态空间构建模块,用于描述智能体Agent i 在决策过程中观察到的状态的集合;状态空间包括电网拓扑结构信息、风力发电和光伏发电量、储能设备荷电状态、负载预测信息、电力市场价格、气象条件、发电机组运行状态;动作空间构建模块,用于指导智能体根据当前状态信息输出最优动作,动作空间包括机组出力调整值、输电线路的开关状态、储能设备的充电或放电功率、电力交易决策、设备维护决策;智能体训练模块,根据不同的调度目标组合S i 构造奖励函数R i ,基于共享的状态空间和动作空间训练智能体Agent i ;调度方案生成模块,配置每个智能体Agent i 的工作时间区间,生成各发电机组的出力分配方案;其中,i>1,对所有目标组合S i 取并集的结果为目标集合S。
2.根据权利要求1所述的一种面向智能电网的多目标优化调度系统,其特征在于,所述调度目标集合S包括,成本最小化、碳排放量最小化、线损最小化、收益最大化、可再生能源利用率最大化、供需平衡、可靠性最大化、最小化负荷曲线峰均比;优选地,每个调度目标组合包括3个调度目标。
3.根据权利要求2所述的一种面向智能电网的多目标优化调度系统,其特征在于,根据不同的调度目标组合S i 构造奖励函数R i ,具体为,对调度目标组合Si包含的3个调度目标的量纲进行归一化,获得 其中Z t 为t时刻的调度方案, 为t时刻的调度目标值;分别计算Z t 与最优解和最差解之间的欧式距离D1和D2;根据欧式距离D1和D2构造奖励函数R i ;
4.根据权利要求3所述的一种面向智能电网的多目标优化调度系统,其特征在于,采用基于策略的学习方式训练智能体Agent i ,具体为:S1:初始化训练次数j=1,设置更新策略时间t和最大训练次数;S2:计算Agent i 在各发电机组上的动作值为策略函数上的随机采样值;S3:根据各发电机组的出力情况获得动作变量值、状态变量值和奖励值;S4:循环步骤S2-S3,如果训练时间大于等于更新策略时间t,执行步骤S5;S5:更新策略,j=j+1;S6:循环步骤S2-S5,直到j达到最大训练次数;S7:保存的智能体Agent i 策略,训练结束。
5.根据权利要求4所述的一种面向智能电网的多目标优化调度系统,其特征在于,所述采用基于策略的学习方式训练智能体Agent i ,其中,基于策略的学习方式为以下任一项:自适应策略梯度方法(Adaptive Policy Gradient Methods),确定性策略梯度方法(Deterministic Policy Gradient Methods),深度策略梯度方法(Deep Policy GradientMethods)。
6.根据权利要求5所述的一种面向智能电网的多目标优化调度系统,其特征在于,根据气象条件信息自动生成每个智能体Agent i 的工作时间区间Q i 的配置信息,该配置信息支持手工编辑;每个智能体Agent i 在工作时间区间Q i 生成实时电网调度计划。
7.一种面向智能电网的多目标优化调度方法,其特征在于,包括以下步骤:构建状态空间步骤,根据电网拓扑结构信息、风力发电和光伏发电量、储能设备荷电状态、负载预测信息、电力市场价格、气象条件、发电机组运行状态信息构建智能体Agent i 在决策过程中观察到的状态集合;构建动作空间步骤,根据各机组出力调整值、输电线路的开关状态、储能设备的充电或放电功率、电力交易决策、设备维护决策构建Agent i 的动作集合;调度目标组合步骤,从调度目标集合S中选择调度目标组合S i ,调度目标组合S i 用于指导智能体Agent i 对环境状态的改变进行评估,根据评估值对动作进行优化;智能体训练步骤,根据不同的调度目标组合S i 构造奖励函数R i ,基于共享的状态空间和动作空间训练智能体Agent i ;调度方案生成步骤,配置每个智能体Agent i 的工作时间区间,生成各发电机组的出力分配方案。
8.根据权利要求7所述的一种面向智能电网的多目标优化调度方法,其特征在于,构建动作空间步骤中根据各机组出力调整值,包括,火电机组出力调整值,风电机组出力调整值,光伏机组出力调整值。
9.根据权利要求8所述的一种面向智能电网的多目标优化调度方法,其特征在于,所述调度目标集合S包括,成本最小化、碳排放量最小化、线损最小化、收益最大化、可再生能源利用率最大化、供需平衡、可靠性最大化、最小化负荷曲线峰均比;优选地,每个调度目标组合包括3个调度目标。
10.根据权利要求9所述的一种面向智能电网的多目标优化调度方法,其特征在于,根据不同的调度目标组合S i 构造奖励函数R i ,具体为,对调度目标组合Si包含的3个调度目标的量纲进行归一化,获得 其中Z t 为t时刻的调度方案, 为t时刻的调度目标值;分别计算Z t 与最优解和最差解之间的欧式距离D1和D2;根据欧式距离D1和D2构造奖励函数R i ;