1.一种基于强化学习的惯量飞轮控制方法,其特征在于,包括:将经过交互仿真环境和神经网络得到的转换经验多元组(s t ,a t ,r t ,s t+1 )存储至经验池中,从当前时刻的经验池中随机采样的设定数量的经验多元组以更新神经网络,其中,s t 为惯量飞轮输出端当前时刻t的状态量,a t 为当前时刻t的状态量对应的动作,r t 为当前时刻t的奖励,s t+1 为下一时刻的动作;根据当前时刻的经验池中所有经验多元组中的奖励判断是否满足神经网络更新结束条件;响应于满足所述神经网络更新结束条件,将更新后的所述神经网络作为训练完成的神经网络;以及响应于未满足所述神经网络更新结束条件,返回至更新神经网络的步骤,直至满足神经网络更新结束条件,将最后一次执行更新神经网络的步骤更新的神经网络作为训练完成的神经网络;将需要进行控制量计算的惯量飞轮输出端的状态量输入至训练完成的神经网络获取动作,基于动作和转矩设定值获取待输入至惯量飞轮的控制量。
2.根据权利要求1所述的基于强化学习的惯量飞轮控制方法,其特征在于,所述状态量包括有功功率、有功功率的微分、无功功率、无功功率的微分、端电压、端电压的微分、转速和转速的微分。
3.根据权利要求1所述的基于强化学习的惯量飞轮控制方法,其特征在于,所述动作包括阻尼电压分量和阻尼转矩分量。
4.根据权利要求1所述的基于强化学习的惯量飞轮控制方法,其特征在于,所述神经网络更新结束条件包括:当前经验池中所有经验多元组中的奖励总和大于奖励总和预设值。
5.根据权利要求1或4所述的基于强化学习的惯量飞轮控制方法,其特征在于,r t 通过奖励函数获取,其中,所述奖励函数为: t step 为设定的时间步长,t为当前时刻,ω e 为惯量飞轮输出端转子的实际转速,ω ref 是惯量飞轮输出端转子的额定转速。
6.根据权利要求1所述的基于强化学习的惯量飞轮控制方法,其特征在于,所述转矩设定值为输入至所述惯量飞轮输出端的转矩设定值,所述转矩设定值通过转矩设定值公式获取,其中,转矩设定值公式为: T为转矩设定值,P ref 为惯量飞轮输出的有功功率,ω m 为惯量飞轮输出端转子的角速度,K flag 为惯量飞轮充放电标志位,惯量飞轮充电时K flag 的取值为-1,惯量飞轮放电时K flag 的取值为+1,ΔP为功率补偿项; R a 为惯量飞轮输出端的相电阻。
7.根据权利要求3所述的基于强化学习的惯量飞轮控制方法,其特征在于,所述控制量包括输入至惯量飞轮的驱动信号和输入至惯量飞轮的励磁电压。
8.根据权利要求7所述的基于强化学习的惯量飞轮控制方法,其特征在于,基于动作和转矩设定值获取待输入至惯量飞轮的控制量包括:将所述阻尼转矩分量和所述转矩设定值进行相加得到转矩基值;获取需要进行控制量计算的惯量飞轮对应的转矩实测值,将转矩基值与转矩实测值相减得到误差值;将得到的误差值输入至PID控制器中经过比例、积分和微分操作后输出至增益放大器进行处理得到第一信号;将第一信号与需要进行控制量计算的惯量飞轮输出端的q轴电流相减后输入至PID控制器中经过比例、积分和微分操作得到第二信号;将第二信号与ω e i d L d 信号和ω e Flux信号相加得到第三信号,将第三信号输入至积分器进行积分处理,并将经过积分处理后的信号输入至脉宽调制器得到输入至惯量飞轮的驱动信号β轴分量,其中,ω e 为惯量飞轮输出端转子的实际转速,i d 为需要进行控制量计算的惯量飞轮输出端的d轴电流,L d 为需要进行控制量计算的惯量飞轮输出端的d轴电感,Flux为需要进行控制量计算的惯量飞轮输出端的磁通量。
9.根据权利要求5所述的基于强化学习的惯量飞轮控制方法,其特征在于,基于动作和转矩设定值获取待输入至惯量飞轮的控制量还包括:将阻尼电压分量、需要进行控制量计算的惯量飞轮输出端的电压实测值以及需要进行控制量计算的惯量飞轮输出端的电压给定值输入至励磁控制器得到励磁电压。
10.一种基于强化学习的惯量飞轮控制系统,其特征在于,采用如权利要求1-9任一项所述的基于强化学习的惯量飞轮控制方法控制惯量飞轮,所述系统包括:神经网络更新模块,其用于将经过交互仿真环境和神经网络得到的转换经验多元组存储至经验池中,从当前时刻的经验池中随机采样的设定数量的经验多元组以更新神经网络;数据处理模块,其用于根据当前时刻的经验池中所有经验多元组中的奖励判断是否满足神经网络更新结束条件,响应于满足所述神经网络更新结束条件,将更新后的所述神经网络作为训练完成的神经网络,以及响应于未满足所述神经网络更新结束条件,采用神经网络更新模块再次更新神经网络,直至满足神经网络更新结束条件,将最后一次执行更新神经网络时更新的神经网络作为训练完成的神经网络;控制量获取模块,将需要进行控制量计算的惯量飞轮输出端的状态量输入至训练完成的神经网络获取动作,基于动作和转矩设定值获取待输入至惯量飞轮的控制量。