1.一种基于迭代算法求解的机器人数据驱动控制方法,其特征在于,所述方法包括:根据待优化的线性增益矩阵和升维特征函数,构建机器人动力学模型的控制策略;所述升维特征函数是在Koopman算子框架中将机器人的原始状态空间映射到高维特征空间,以此将控制策略的非线性优化问题转化为高维线性优化问题;将控制策略的非线性优化问题转化为高维线性优化问题,包括:将控制策略的非线性优化问题转化为高维线性优化问题为:其中, 所述高维线性优化问题满足高维下的模型约束为:s + 表示s的下一个状态,w和v均表示模型误差;在线性空间中,定义Q函数为:Q(z k )=l(z k )+γV(As k +Bu k +w k )其中,z=(s,u),s表示所述升维特征函数Ψ(x)的简化表示,u表示所述控制策略,r(z k )=|u k | 2 +|s k | 2 ,A、B、C均为求解所述高维特征空间的模型参数,w k 为模型误差,γ表示折扣因子,V(·)表示状态值函数;根据所述Q函数,定义 其中 q=n ψ +m,n ψ 表示升维特征函数的空间维度,m表示控制策略的维度, 是与 相关的矩阵 的向量化;以数据驱动方式使用z=(s,u)的数据样本迭代计算矩阵 的更新值h i ,计算所述线性增益矩阵,以此得到机器人动力学模型的控制策略u;以数据驱动方式使用z=(s,u)的数据样本迭代计算矩阵 的更新值h i ,计算所述线性增益矩阵,包括:定义 在第i次迭代时,通过最小二乘法计算 的更新值h i 为:使用所述z=(s,u)的数据样本迭代计算矩阵 的更新值h i ,计算所述线性增益矩阵;所述方法还包括:设置数据样本z=(s,u)的数据集为 记 定义ΔZ=Z-γZ + ,并要求ΔZΔZ T 满秩,定义所述控制策略为:其中,d为零均值噪声;所述方法还包括:更新值h i 的计算公式为:h i =(ΔZΔZ T ) -1 ΔZY其中,
2.根据权利要求1所述的方法,其特征在于,构造升维特征函数的步骤包括:使用一组基函数构造升维特征函数Ψ(x),升维特征函数Ψ(x)的表达式为:其中,c i 表示基函数的核心,σ i 表示基函数的宽度。
3.根据权利要求1所述的方法,其特征在于,构造升维特征函数的步骤包括:使用多层神经网络构造升维特征函数Ψ(x),升维特征函数Ψ(x)的表达式为:其中,L表示网络层数,第j层隐藏层的输出描述为:g j (x)=σ j (W j g j-1 (y j-1 )+b j )其中,y j-1 是第j-1层网络的输出, 表示权重矩阵,σ j 表示激活函数,b j 表示偏置项。
4.根据权利要求1所述的方法,其特征在于,所述方法还包括:对所述Q函数简化为:其中, Ξ su (P k )=γA T P k B,Ξ ss (P k )=γB T P k A,Ξ ss (P k )=R+γA T P k B。
5.一种基于迭代算法求解的机器人数据驱动控制装置,其特征在于,用于实现权利要求1至4任一项所述的基于迭代算法求解的机器人数据驱动控制方法,所述装置包括:转化模块,用于根据待优化的线性增益矩阵和升维特征函数,构建机器人动力学模型的控制策略;所述升维特征函数是在Koopman算子框架中将机器人的原始状态空间映射到高维特征空间,以此将控制策略的非线性优化问题转化为高维线性优化问题;Q函数定义模块,用于在线性空间中,定义Q函数为:Q(z k )=l(z k )+γV(As k +Bu k +w k )其中,z=(s,u),s表示所述升维特征函数Ψ(x)的简化表示,u表示所述控制策略,l(z k )=|u k | 2 +|s k | 2 ,A、B、C均为求解所述高维特征空间的模型参数,w k 为模型误差,γ表示折扣因子,V(·)表示状态值函数;Q函数转化模块,用于根据所述Q函数,定义 其中 q=n ψ +m,n ψ 表示升维特征函数的空间维度,m表示控制策略的维度, 是与 相关的矩阵 的向量化;控制策略计算模块,用于以数据驱动方式使用z=(s,u)的数据样本迭代计算矩阵 的更新值h i ,计算所述线性增益矩阵,以此得到机器人动力学模型的控制策略。
6.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至4中任一项所述方法的步骤。