1.一种基于模型引导离线强化学习的机器人控制方法,其特征在于,步骤包括:步骤S01.构建非线性机器人的线性增量模型,所述线性增量模型中包括机器人的状态输入 x 以及控制输入的增量 ,基于所述非线性机器人的线性增量模型构建 函数,所述 函数中包括状态输入 x 以及控制输入的增量 ,构建的所述 函数的表达式为:其中, P 为对称正定矩阵, Q 和 R 分别为状态和输入的代价函数权重矩阵, 为增量策略矩阵, B 表示输入矩阵, A 表示状态转移矩阵,为已知的单位阵,k表示时间步, x 表示机器人的状态, I 表示单位阵, 、 分别表示对 A、B 进行增广后得到的矩阵;步骤S02.使用预先收集的机器人数据集迭代求解 ,k表示时间步,得到控制输入的增量 对应的最优增量策略,同时学习得到线性增量模型;步骤S03.使用步骤S02学习到的所述线性增量模型进行前向预测产生状态输入与控制输入的合成数据集,并加入至预先收集的机器人数据集中以对机器人数据集进行扩充,形成增强数据集;步骤S04.利用所述增强数据集训练机器人的强化学习策略,使用训练好的强化学习策略对机器人进行实时控制。
2.根据权利要求1所述的基于模型引导离线强化学习的机器人控制方法,其特征在于,构建线性增量模型为:其中, x 表示机器人的状态, 表示控制输入的增量, B 表示输入矩阵, A 表示状态转移矩阵,为已知的单位阵,k表示时间步;将线性增量模型进行扩展形成增广增量系统,构建得到增广后的线性增量模型为:其中, I 表示单位阵, 、 分别表示对 A、B 进行增广后得到的矩阵。
3.根据权利要求2所述的基于模型引导离线强化学习的机器人控制方法,其特征在于,通过求解 得到最优增量策略矩阵 为:得到相对应的最优增量策略为 。
4.根据权利要求3所述的基于模型引导离线强化学习的机器人控制方法,其特征在于,步骤S02还包括求解矩阵 Z ,通过按照式 迭代学习 ,得到最小二乘形式的解: 表示第j次迭代中矩阵 Z 的向量化表示, 为惩罚函数, , 表示第k次迭代的惩罚函数值, 表示 Y ( k )的向量化表示, 表示 L 的向量化表示, l 表示数据集中的数据序号。
5.根据权利要求4所述的基于模型引导离线强化学习的机器人控制方法,其特征在于, 的构建步骤包括:根据 , ,得到 函数的Bellman方程如下:根据 得到:进一步转换为:最终构建得到: 。
6.根据权利要求4或5所述的基于模型引导离线强化学习的机器人控制方法,其特征在于,步骤S03包括:步骤S301.根据迭代求解得到的矩阵 Z 计算出 ,根据计算出的 学习得到线性增量模型;步骤S302.根据学习得到的线性增量模型进行前向预测得到合成数据集;步骤S303.将所述合成数据集加入至预先收集的机器人数据集中形成增强数据集。
7.根据权利要求6所述的基于模型引导离线强化学习的机器人控制方法,其特征在于,步骤S301中按照式 计算出 ,进而确定出线性增量模型 。
8.根据权利要求6所述的基于模型引导离线强化学习的机器人控制方法,其特征在于,步骤S302中,按照下式进行前向预测:其中,i表示执行前向预测的步数;由预测得到的 形成所述合成数据集。
9.一种基于模型引导离线强化学习的机器人控制系统,包括处理器以及存储器,所述存储器用于存储计算机程序,其特征在于,所述处理器用于执行所述计算机程序以执行如权利要求1~8中任意一项所述方法。
10.一种存储有计算机程序的计算机可读存储介质,其特征在于,所述计算机程序被处理器执行时实现如权利要求1~8中任意一项所述的方法。