1.一种控制策略样本生成方法,其特征在于,包括:获取系统运行点;生成初始对抗智能体及初始策略智能体;以调整所述初始对抗智能体的极端运行点生成概率为目标,对所述初始对抗智能体进行参数调整;结合零和博弈,对所述初始策略智能体及经过参数调整的初始对抗智能体进行交替训练,将最终得到的初始策略智能体作为策略智能体,将最终得到的初始对抗智能体作为对抗智能体;利用所述对抗智能体,对所述系统运行点进行处理,生成对抗运行状态;将所述对抗运行状态输入至所述策略智能体,生成与所述对抗运行状态匹配的控制策略,所述对抗运行状态及所述控制策略形成控制策略样本;在交替训练过程中,所述初始策略智能体的奖励函数为: ;所述初始对抗智能体的奖励函数为: ;其中, 为初始策略智能体的奖励值; 为输入至初始策略智能体的运行状态; 为对应的控制策略;D为输入至初始策略智能体的运行状态组成的训练集; 、 为预设的系数; 为在电网系统当前的运行状态s与控制策略a下,电网系统达到准稳态时的节点电压; 为成本函数; 为初始对抗智能体的奖励值。
2.根据权利要求1所述的控制策略样本生成方法,其特征在于,生成初始对抗智能体,包括:生成结合SAC算法及单步马尔可夫决策过程构建而成的智能体;依次将多个历史运行点输入至所述智能体中,得到每个历史运行点对应的预测运行点;基于KL散度,计算每个历史运行点及其对应的预测运行点间的相似度;基于每个相似度,对最新的智能体进行参数调整,直至相似度符合预设的相似阈值为止,将最终得到的智能体作为初始对抗智能体。
3.根据权利要求1所述的控制策略样本生成方法,其特征在于,所述以调整所述初始对抗智能体的极端运行点生成概率为目标,对所述初始对抗智能体进行参数调整,包括:基于ε-贪婪算法,以调整所述初始对抗智能体的极端运行点生成概率为目标,对所述初始对抗智能体进行参数调整。
4.根据权利要求1所述的控制策略样本生成方法,其特征在于,所述结合零和博弈,对所述初始策略智能体及经过参数调整的初始对抗智能体进行交替训练,包括:确定基于零和博弈设置的初始对抗智能体及初始策略智能体的奖励函数;停止对初始对抗智能体进行参数调整,并获取两类训练运行状态,其中,一类训练运行状态为随机从电网系统中选取的运行状态;另一类训练运行状态为基于最新的初始对抗智能体处理得到的多个运行状态;依次将每个训练运行状态输入至最新的初始策略智能体,得到每个训练运行状态对应的训练控制策略;基于每个训练运行状态及其对应的训练控制策略,结合初始策略智能体的奖励函数,计算对应的训练奖励值,并基于每个训练奖励值对最新的初始策略智能体进行参数调整,直至符合停止条件为止;停止对初始策略智能体进行参数调整,并获取多个目标运行点;依次将每个目标运行点输入至最新的初始对抗智能体,生成每个目标运行点对应的目标运行状态;依次将每个目标运行状态输入至最新的初始策略智能体,得到每个目标运行状态对应的目标控制策略;基于每个目标运行状态及其对应的目标控制策略,结合初始对抗智能体的奖励函数,计算对应的目标奖励值,并基于每个目标奖励值对初始对抗智能体进行参数调整,直至符合停止条件为止;返回执行停止对初始对抗智能体进行参数调整,并获取两类训练运行状态的步骤,直至初始对抗智能体及初始策略智能体皆收敛为止。
5.根据权利要求4所述的控制策略样本生成方法,其特征在于,所述确定基于零和博弈设置的初始对抗智能体及初始策略智能体的奖励函数,包括:设置初始策略智能体的奖励函数,并设置初始对抗智能体的奖励函数为初始策略智能体在样本空间下奖励下限的相反数。
6.根据权利要求1所述的控制策略样本生成方法,其特征在于,所述利用所述对抗智能体,对所述系统运行点进行处理,生成对抗运行状态,包括:将所述系统运行点输入至所述对抗智能体,得到所述对抗智能体输出的对抗运行点;对所述对抗运行点进行仿真,得到对抗运行状态。
7.一种控制策略样本生成装置,其特征在于,包括:获取模块,用于获取系统运行点;生成初始对抗智能体及初始策略智能体;以调整所述初始对抗智能体的极端运行点生成概率为目标,对所述初始对抗智能体进行参数调整;结合零和博弈,对所述初始策略智能体及经过参数调整的初始对抗智能体进行交替训练,将最终得到的初始策略智能体作为策略智能体,将最终得到的初始对抗智能体作为对抗智能体;在交替训练过程中,所述初始策略智能体的奖励函数为: ;所述初始对抗智能体的奖励函数为: ;其中, 为初始策略智能体的奖励值; 为输入至初始策略智能体的运行状态; 为对应的控制策略;D为输入至初始策略智能体的运行状态组成的训练集; 、 为预设的系数; 为在电网系统当前的运行状态s与控制策略a下,电网系统达到准稳态时的节点电压; 为成本函数; 为初始对抗智能体的奖励值;处理模块,用于利用所述对抗智能体,对所述系统运行点进行处理,生成对抗运行状态;生成模块,用于将所述对抗运行状态输入至所述策略智能体,生成与所述对抗运行状态匹配的控制策略,所述对抗运行状态及所述控制策略形成控制策略样本。
8.一种控制策略样本生成设备,其特征在于,包括存储器和处理器;所述存储器,用于存储程序;所述处理器,用于执行所述程序,实现如权利要求1-6中任一项所述的控制策略样本生成方法的各个步骤。
9.一种可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时,实现如权利要求1-6中任一项所述的控制策略样本生成方法的各个步骤。