有效

一种基于强化学习的惯量飞轮控制方法及系统

李同辉、姜新建、孙坤元、倪泽龙、唐宏芬、张宏博、高大伟、王丽杰、刘帅伟
中国大唐集团科技创新有限公司

摘要

本申请公开了一种基于强化学习的惯量飞轮控制方法及系统,所述方法包括:将经过交互仿真环境和神经网络得到的转换经验多元组存储至经验池中,从当前时刻的经验池中随机采样的设定数量的经验多元组以更新神经网络;根据当前经验池中的奖励判断是否满足神经网络更新结束条件,若满足则将更新后的神经网络作为训练完成的神经网络,否则继续更新神经网络直至满足结束条件;将需要进行控制量计算的惯量飞轮输出端的状态量输入至训练完成的神经网络获取动作,基于动作和转矩设定值获取待输入至惯量飞轮的控制量。利用本申请的方案,能够使得神经网络能够根据实际表现调整其策略,更准确地预测和计算惯量飞轮输出端的状态量对应的动作。