1.一种LCL型并网逆变器控制方法,其特征在于,包括:获取第一LCL型并网逆变器在第一时刻的第一状态,其中,所述第一状态至少包括:所述第一LCL型并网逆变器与电网间的两相电流和两相电压、所述第一LCL型并网逆变器内部的两相电流和两相电压;利用深度强化学习模型对所述第一状态进行分析,决策得到所述第一LCL型并网逆变器的目标三相开关动作,其中,所述深度强化学习模型是利用经验回放池内的多个经验元对深度Q网络进行迭代训练所得,所述经验元包括第二LCL型并网逆变器在第二时刻的第二状态、按照贪心策略所选择的三相开关动作、执行三相开关动作时获得的奖励和新的第二状态,所述奖励为所述第二LCL型并网逆变器执行所选择的三相开关动作时所述第二LCL型并网逆变器与电网间的两相电流与预设的电网参考电流之间的误差;按照决策所得的所述目标三相开关动作对所述第一LCL型并网逆变器进行控制;其中,所述深度强化学习模型的训练过程包括:获取训练样本集和样本标签集,其中,所述训练样本集包括:多个由第二LCL型并网逆变器在第二时刻的第二状态组成的训练样本,所述样本标签集包括:多个训练样本的样本标签,且所述样本标签用于表征最小化所述第二LCL型并网逆变器与电网间的两相电流与预设的电网参考电流的差值的第二LCL型并网逆变器的三相开关动作;基于深度Q网络构建初始模型;利用所述训练样本集和所述样本标签集对所述初始模型进行迭代训练,得到所述深度强化学习模型。
2.根据权利要求1所述的方法,其特征在于,获取第一LCL型并网逆变器在第一时刻的目标状态,包括:获取第一时刻下所述第一LCL型并网逆变器与电网间的三相电流和三相电压以及所述第一LCL型并网逆变器内部的三相电流和三相电压;将所述第一LCL型并网逆变器与电网间的三相电压作为锁相环的输入信号,得到相位;基于所述相位,使用帕克变换分别将所述第一LCL型并网逆变器与电网间的三相电流和三相电压以及所述第一LCL型并网逆变器内部的三相电流和三相电压从三相静止坐标系转换至与电压同步旋转的d-q坐标系中,得到所述第一LCL型并网逆变器与电网间的两相电流和两相电压以及所述第一LCL型并网逆变器内部的两相电流和两相电压。
3.根据权利要求1所述的方法,其特征在于,所述电网参考电流的确定过程包括:对于每个所述第二LCL型并网逆变器,获取所述第二LCL型并网逆变器在第二时刻的有功功率指令和无功功率指令;基于所述有功功率指令和无功功率指令以及第二时刻下所述第二LCL型并网逆变器与电网间的两相电压确定所述电网参考电流。
4.根据权利要求1所述的方法,其特征在于,利用所述训练样本集和所述样本标签集对所述初始模型进行迭代训练,得到所述深度强化学习模型,包括:基于所述训练样本集定义状态空间,其中,状态空间内的每个状态表示所述第二LCL型并网逆变器在第二时刻的第二状态;基于所述样本标签集定义动作空间,其中,动作空间内的每个动作表示所述第二LCL型并网逆变器的三相开关动作;初始化深度Q网络,其中,所述深度Q网络包括在线网络和目标网络;使用所述在线网络从所述状态空间内选择一个第二状态,依据所述第二状态,利用贪心算法选择Q值大于预设阈值的三相开关动作;确定所述第二LCL型并网逆变器执行所选择的三相开关动作时的奖励和新的第二状态;将所述第二LCL型并网逆变器在第二时刻的第二状态、所述第二LCL型并网逆变器执行的三相开关动作、所述第二LCL型并网逆变器执行所选择的三相开关动作时奖励和新的第二状态组成的经验元存储至经验回放池;使用所述目标网络确定所述经验回放池内的各个经验元的目标Q值,并基于各个所述经验元的Q值和目标Q值对初始模型的模型参数进行调整,得到所述深度强化学习模型。
5.根据权利要求4所述的方法,其特征在于,使用所述目标网络确定所述经验回放池内的各个经验元的目标Q值,并基于各个所述经验元的Q值和目标Q值对初始模型的模型参数进行调整,包括:在每次迭代过程中循环执行如下步骤,直至满足预设的终止条件:按照经验回放机制从所述经验回放池内随机抽取经验元,并使用所述目标网络确定所抽取的各个经验元的目标Q值;基于使用在线网络分析各个所述经验元的Q值和对应目标Q值确定损失函数;利用梯度下降法最小化所述损失函数,以更新所述在线网络的网络参数;间隔至少一个迭代训练过程后将在线网络的网络参数复制给所述目标网络。
6.根据权利要求3所述的方法,其特征在于,按照决策所得的所述目标三相开关动作对所述第一LCL型并网逆变器进行控制,包括:在所述目标三相开关动作内的任一相开关为关闭的情况下,控制所述第一LCL型并网逆变器内对应相开关处于高电平状态;在所述目标三相开关动作内的任一相开关为打开的情况下,控制所述第一LCL型并网逆变器内对应相开关处于低电平状态。
7.一种LCL型并网逆变器控制装置,其特征在于,包括:获取模块,用于获取第一LCL型并网逆变器在第一时刻的第一状态,其中,所述第一状态至少包括:所述第一LCL型并网逆变器与电网间的两相电流和两相电压、所述第一LCL型并网逆变器内部的两相电流和两相电压;决策模块,用于利用深度强化学习模型对所述第一状态进行分析,决策得到所述第一LCL型并网逆变器的目标三相开关动作,其中,所述深度强化学习模型是利用经验回放池内的多个经验元对深度Q网络进行迭代训练所得,所述经验元包括第二LCL型并网逆变器在第二时刻的第二状态、按照贪心策略所选择的三相开关动作、执行三相开关动作时获得的奖励和新的第二状态,所述奖励为所述第二LCL型并网逆变器执行所选择的三相开关动作时所述第二LCL型并网逆变器与电网间的两相电流与预设的电网参考电流之间的误差;控制模块,用于按照决策所得的所述目标三相开关动作对所述第一LCL型并网逆变器进行控制;其中,所述深度强化学习模型的训练过程包括:获取训练样本集和样本标签集,其中,所述训练样本集包括:多个由第二LCL型并网逆变器在第二时刻的第二状态组成的训练样本,所述样本标签集包括:多个训练样本的样本标签,且所述样本标签用于表征最小化所述第二LCL型并网逆变器与电网间的两相电流与预设的电网参考电流的差值的第二LCL型并网逆变器的三相开关动作;基于深度Q网络构建初始模型;利用所述训练样本集和所述样本标签集对所述初始模型进行迭代训练,得到所述深度强化学习模型。
8.一种非易失性存储介质,其特征在于,所述非易失性存储介质中存储有计算机程序,其中,所述非易失性存储介质所在设备通过运行所述计算机程序执行权利要求1至6中任意一项所述的LCL型并网逆变器控制方法。
9.一种计算机程序产品,其特征在于,包括:计算机程序,其中,所述计算机程序被处理器执行时实现权利要求1至6中任意一项所述的LCL型并网逆变器控制方法。