1.一种基于增量强化学习的机器人安全训练方法,其特征在于,所述方法包括:采用历史数据对机器人的非线性系统中未知模型信息进行估计,构建机器人的线性增量系统;所述线性增量系统包括:控制输入增量项和线性化误差项;基于所述线性增量系统构建增广增量系统,并且构建惩罚函数表征机器人完成任务的需求;根据第k步之后的惩罚函数,得到用于评估机器人性能的值函数;根据所述值函数,构建Q函数,利用预先构建的模型引导增量强化学习算法在线迭代求解所述Q函数,得到最优控制策略和最优误差估计策略,以及机器人模型,并利用在线学习到的机器人模型进行前向预测得到额外数据促进强化学习在线训练;在线学习过程中,基于在线学习到的机器人模型,构建二次型约束优化对机器人最优控制策略进行微调,以此实现在线安全学习;采用历史数据构建非线性机器人相对应的线性增量系统,包括:机器人的非线性系统描述为: ;其中, , 分别表示机器人的状态输入和控制输入; , 分别表示状态矩阵和输入矩阵;将所述非线性系统的表达式两边同时乘以常数矩阵B,得到独立出未知模型信息的表达式为: ;其中, 包含了所有的未知模型信息;采用历史数据对未知模型信息 进行估计为: ;合并各表达式得到线性增量系统为: ;其中, 表示线性化误差项, 为控制输入增量项, 为单位阵;基于所述线性增量系统构建增广增量系统包括:基于所述线性增量系统构建增广增量系统为: ;其中, ;构建惩罚函数,包括:构建控制输入增量项对应的控制策略以及线性化误差项对应的估计策略分别为 和 ;根据所述控制策略和所述估计策略构建惩罚函数为: ;其中,Q表示状态权重矩阵,R表示输入权重矩阵, 表示估计误差策略对应的系数;根据第k步之后的惩罚函数,得到用于评估机器人性能的值函数,包括:根据第k步之后的惩罚函数,得到用于评估机器人性能的值函数为: ;根据所述值函数,构建Q函数,利用预先构建的模型引导增量强化学习算法在线迭代求解所述Q函数,得到最优控制策略和最优误差估计策略,以及机器人模型,包括:根据所述值函数,构建Q函数为: ;所述值函数可表述为: ;P 为对称正定矩阵;对Q函数进一步化简为: ;为方便算法开发,将Q函数表示为: ;其中, ; ;通过求解, 和 得到最优策略矩阵和最优估计误差策略矩阵为: ; ;根据 ,可以得到Q函数的Bellman方程为: ;根据公式 ,可得: ;将 化简为: ; ; ; ;通过模型引导增量强化学习算法迭代学习 ,在第 次迭代过程为: ; ; ;从估计的 矩阵中提取机器人模型的模型信息: ;根据所述模型信息,进行前向预测,并且将前向预测产生的数据用于构建 矩阵和 矩阵,促进机器人策略的高效在线训练。
2.根据权利要求1所述的基于增量强化学习的机器人安全训练方法,其特征在于,在线学习过程中,基于上述在线学习到的机器人模型,构建二次型约束优化对机器人最优控制策略进行微调,以此实现在线安全学习,包括:在线学习过程中,构建二次型约束优化为: ;其中, 表示输入约束集; 表示增量输入约束集; 为描述障碍物边缘的控制障碍函数。
3.一种基于增量强化学习的机器人安全训练装置,用于实现权利要求1至2任一项所述的基于增量强化学习的机器人安全训练方法,其特征在于,所述装置包括:线性系统构建模块,用于采用历史数据对机器人的非线性系统中未知模型信息进行估计,构建机器人的线性增量系统;所述线性增量系统包括:控制输入增量项和线性化误差项;惩罚函数构建模块,用于基于所述线性增量系统构建增广增量系统,并且构建惩罚函数表征机器人完成任务的需求;策略求解模块,用于根据第k步之后的惩罚函数,得到用于评估机器人性能的值函数;根据所述值函数,构建Q函数,利用预先构建的模型引导增量强化学习算法在线迭代求解所述Q函数,得到最优控制策略和最优误差估计策略,以及机器人模型,并利用在线学习到的机器人模型进行前向预测得到额外数据促进强化学习在线训练;在线安全学习模块,用于在线学习过程中,基于在线学习到的机器人模型,构建二次型约束优化对机器人最优控制策略进行微调,以此实现在线安全学习。
4.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至2中任一项所述方法的步骤。