1.一种基于风险敏感强化学习的机器人安全规划控制方法,其特征在于,所述方法包括:获取机器人数据;根据所述机器人数据构建机器人深度增量模型;构建机器人安全规划控制架构;所述机器人安全规划控制架构包括规划层和控制层;在所述规划层以机器人深度增量模型为约束条件设计参考轨迹;根据专家经验确定控制层的追踪误差上下界,利用所述追踪误差上下界构建用于碰撞检测的缓冲区;在所述控制层基于缓冲区大小构建风险敏感函数,以风险敏感函数为基础构建表征以能量最优和特定性能追踪参考轨迹的最优值函数;对所述最优值函数进行求解,得到作用在机器人上用于追踪的输入,驱动机器人安全完成既定任务。
2.根据权利要求1所述的方法,其特征在于,根据所述机器人数据构建机器人深度增量模型,包括:根据两个相邻时间步的机器人状态-输入信息和增量矩阵计算得到机器人的增量模型;以最小化估计误差为目标,利用深度神经网络参数化增量矩阵,并基于预先构建的数据集,从监督学习角度离线学习得到最优增量矩阵,利用深度神经网络参数化的增量矩阵构建机器人深度增量模型。
3.根据权利要求2所述的方法,其特征在于, 根据两个相邻时间步的机器人状态-输入信息和增量矩阵计算得到机器人的增量模型,包括:根据两个相邻时间步的机器人状态-输入信息和增量矩阵计算得到机器人的增量模型为 ;其中, 表示相邻两个采样时刻系统状态导数的差值, 表示机器人状态导数在上一个采样时刻的值, 为增量输入, 表示估计误差, 表示当前步的未知模型信息, 表示未知模型信息的估计值, 表示机器人状态, 表示增量矩阵, 表示输入信息u上一个采样时刻的值, 表示机器人系统的采样时间, 表示时间。
4.根据权利要求2所述的方法,其特征在于,根据深度神经网络参数化的增量矩阵构建机器人深度增量模型,包括:根据深度神经网络参数化的增量矩阵构建机器人深度增量模型为 ;其中, 表示机器人状态导数在上一个采样时刻的值, 表示深度神经网络参数化的增量矩阵, 为增量输入, 表示时间。
5.根据权利要求1所述的方法,其特征在于,基于缓冲区构建风险敏感函数,包括:基于缓冲区构建风险敏感函数为 ;其中, , , 表示追踪误差的第 i 个分量, 表示期望输入的第 i 个分量,特定性能函数 的具体表达式为 , , , , ,和 为与缓冲区边界密切的相关超参数, 表示时间, , 为待设计的风险敏感系数, 表示参数 的平方值, 表示参数 的平方值。
6.根据权利要求1所述的方法,其特征在于,利用风险敏感函数构建表征以能量最优和特定性能追踪参考轨迹的最优值函数,包括:利用风险敏感函数构建表征以能量最优和特定性能追踪参考轨迹的最优值函数为 ;其中, 表示差分增量输入, 表示增广状态, 表示效应函数, 表示风险敏感函数, 表示控制权重矩阵。
7.根据权利要求6所述的方法,其特征在于,对所述最优值函数进行求解,得到作用在机器人上用于追踪的输入,包括:最优值函数满足下式HJB方程: ;根据最优性条件和HJB方程,得到最优控制的显示解为: ;其中, 表示最优值函数的偏微分;对所述最优值函数进行逼近为 ;其中, 为权重矩阵, 为激活函数, 为逼近误差;则最优值函数进行逼近后的偏微分形式为 ;其中, 表示变量 针对状态 的偏微分;将最优值函数进行逼近后的偏微分形式代入HJB方程,得到Lyaounov 方程为 ;其中, 为残差项;定义 , 将Lyaounov 方程进行改写,得到改写后的Lyaounov 方程为 ;其中, 表示权重 的估计值;定义 ,估计误差形式为 ;根据设计的神经网络权重更新率更新权重来优化估计误差,用估计的权重构建增量策略;根据增量策略和上一时间步的输入值计算得到当前时间步作用在机器人上用于追踪的输入为 ;其中, 表示增量策略, 参考轨迹对应的期望增量输入, 表示上一时间步的输入值。
8.根据权利要求7所述的方法,其特征在于,根据设计的神经网络权重更新率更新来最优化估计误差,包括:所述设计的神经网络权重更新率为其中, , , 为选定的权重更新超参数, 表示所有的经验池的大小, , 表示经验池中元素的第 个分量。
9.根据权利要求7所述的方法,其特征在于,用估计的权重构建增量策略,包括:用估计的权重构建增量策略为 ;其中, 表示控制权重矩阵, 表示误差动力学对应的输入矩阵, 表示激活函数 针对状态 的偏微分, 表示权重 的估计值,上标T表示转置运算。
10.一种基于风险敏感强化学习的机器人安全规划控制系统,其特征在于,所述系统包括:机器人安全规划控制架构设计模块,用于获取机器人数据;根据所述机器人数据和机器人物理结构知识构建机器人深度增量模型;构建机器人安全规划控制架构;所述机器人安全规划控制架构包括规划层和控制层;规划模块,用于在所述规划层以机器人深度增量模型为约束条件设计参考轨迹;根据专家经验确定控制层的追踪误差上下界,利用所述追踪误差上下界构建缓冲区;控制模块,用于在所述控制层基于缓冲区构建风险敏感函数,利用风险敏感函数构建表征以能量最优和特定性能追踪参考轨迹的最优值函数;对所述最优值函数进行求解,得到作用在机器人上用于追踪的输入,驱动机器人安全完成既定任务。