1.一种融合控制律模型的固定翼飞机控制策略持续优化方法,其特征在于,所述方法包括:在融合控制律模型的固定翼飞机控制器上通过一个制导律模型获取固定翼飞机完成速度矢量控制的专家数据,将所述专家数据作为种子示例数据放入示例数据库进行离线模仿学习,输出离线控制策略;利用自课程学习算法由易到难的挑选训练中采样数据需要使用的目标,基于所述目标采样训练数据,并通过在线强化学习算法对所述离线控制策略进行在线持续优化,得到最优目标控制策略;根据所述最优目标控制策略采样目标轨迹,并使用预设的数据更新算子更新所述示例数据库中的专家数据;根据所述目标轨迹的对称轨迹与预设的数据增强算子强化更新所述示例数据库中的专家数据;将所述示例数据库中已更新的专家数据作为下一轮训练的专家数据进行离线模仿学习,直至迭代训练达到预设迭代轮次。
2.根据权利要求1所述的方法,其特征在于,在融合控制律模型的固定翼飞机控制器上通过一个制导律模型获取固定翼飞机完成速度矢量控制的专家数据,包括:使用制导律模型在融合控制律模型的固定翼飞机控制器上获取所述固定翼飞机完成速度矢量控制的专家数据:其中,v c 为目标真空速度,μ c 为目标航迹倾斜角,χ c 为目标航迹方位角,Δμ=μ c -μ为当前时刻在航迹倾斜角上的误差,ΔX=X c -X为当前时刻在航迹方位角上的误差,T μ 为消除航迹倾斜角误差的用时估计,T x 为消除航迹方位角误差的用时估计,V g 为固定翼飞机地面速度,V g,hor 为固定翼飞机地面速度的水平分量,φ c 为滚转角指令的中间变量,k p,p 为控制加速踏板的PID控制器的比例项系数,k d,p 为控制加速踏板的PID控制器的微分项系数,k p,pla 为控制加速踏板的PID控制器的比例项系数,Δpla为防止飞机速度下降的配平量。
3.根据权利要求2所述的方法,其特征在于,将所述专家数据作为种子示例数据放入示例数据库进行离线模仿学习,输出离线控制策略,包括:将所述专家数据作为种子示例数据放入示例数据库后,采用行为克隆算法与集成学习算法对离线模仿学习模型进行参数优化,得到最优离线参数:其中,s为固定翼飞机的状态,g为目标,a为固定翼飞机的动作, 为第j轮离线模仿学习的迭代训练中的专家数据, 表示从 采样状态-目标-动作三元组, 为离线控制策略,N为离线模仿学习的迭代训练轮数,δ为高斯噪声,H(·)为离线控制策略的熵, 为熵损失项的系数,θ i 为多个离线控制策略中第i个策略的参数,K为离线控制策略的个数;根据所述最优离线参数优化策略后,输出当前迭代步对应的离线控制策略。
4.根据权利要求3所述的方法,其特征在于,利用自课程学习算法由易到难的挑选训练中采样数据需要使用的目标,基于所述目标采样训练数据,包括:在在线强化学习训练中,周期性的评估训练中的策略与记录评估结果,使用高斯混合模型根据历史评估结果评估所述离线控制策略的目标完成能力,生成目标完成概率,若对于当前目标,所述目标完成概率大于预设概率,则输出当前目标;否则,随机生成一个新目标,直至每一个目标对应的目标完成概率均大于预设概率;将所述目标作为后续在线强化学习训练中采样数据使用的行为目标。
5.根据权利要求4所述的方法,其特征在于,通过在线强化学习算法对所述离线控制策略进行在线持续优化,包括:将所述自课程学习方法挑选出的目标输出至在线强化学习模型进行训练数据采样,以使所述在线强化学习模型采用PPO算法对所述离线控制策略进行优化,得到最优损失项:其中, 为最优损失项, 为PPO算法的原始损失项,D KL (·,·)为两个分布的KL距离, 为KL损失的系数;根据所述最优损失项对所述离线控制策略进行在线优化训练,得到最优目标控制策略。
6.根据权利要求5所述的方法,其特征在于,根据所述最优目标控制策略采样目标轨迹,并使用预设的数据更新算子更新所述示例数据库中的专家数据,包括:根据所述最优目标控制策略采样目标轨迹,数据更新算子按如下规则更新所述示例数据库:遍历所有采样的目标轨迹,若所述示例数据库中轨迹覆盖的目标集未包含某一目标轨迹能完成的目标,则添加当前目标轨迹至所述示例数据库;否则,若所述示例数据库中轨迹覆盖的目标集包含某一目标轨迹能完成的目标,且所述目标轨迹的长度小于所述示例数据库中完成所述目标的轨迹的长度,则根据所述目标轨迹更新所述示例数据库中对应的轨迹。
7.根据权利要求1至6任一项所述的方法,其特征在于,所述数据更新算子的定义为:对于示例数据库中任意一条轨迹,根据所述轨迹在航迹方位角上存在的对称性,得到对称轨迹;基于全部所述对称轨迹采用数据刚更新算子更新所述示例数据库;所述目标为固定翼无人机的目标速度矢量。
8.根据权利要求7所述的方法,其特征在于,将所述示例数据库中已更新的专家数据作为下一轮训练的专家数据进行离线模仿学习,重复执行上述步骤到预定的次数,包括:将所述示例数据库中已更新的专家数据与已强化更新的专家数据合并,得到已更新的专家示例数据:其中, 为第j轮训练中的示例数据库, 为第j轮训练中第i个最优控制策略的采样轨迹集合;将所述已更新的专家示例数据作为下一迭代步对应的种子示例数据进行离线模仿学习,重复执行上述步骤到预定的次数。