1.一种同策略多目标强化学习框架的设计方法,其特征在于,所述方法包括:构建同策略多目标优化模型;所述同策略多目标优化模型包括:预训练模型与策略优化模型;所述预训练模型基于专家示范数据对当前行动策略进行优化训练,得到待强化策略,具体步骤为:所述预训练模型基于专家示范数据采用行为克隆方法优化模型的参数,得到预训练模型参数的优化目标: ;其中, 为预训练模型参数的优化目标, 为固定翼飞机的当前时刻动作, 为固定翼飞机的当前时刻状态; 为由状态-动作(s,a)组成的专家示范数据集, 为从专家示范数据集中采样的状态-动作对, 为状态-动作对的期望, 为预训练模型参数构成的待强化策略;根据所述优化目标对当前行动策略进行优化训练,得到待强化策略;在所述策略优化模型上,评估所述待强化策略的目标完成能力,具体步骤为:在所述策略优化模型上,周期性的评估正在训练的所述待强化策略,以获取评估数据,将所述评估数据记录到预设的策略评估集合中,根据所述策略评估集合中的评估数据采用高斯混合模型估计所述待强化策略的目标完成能力;所述策略评估集合包括:在评估中所述待强化策略能够完成的目标样本与所述目标样本对应的权重;根据所述目标完成能力获取目标采样概率分布,根据所述目标采样概率分布采样行为目标,根据采样得到的所述行为目标收集训练数据,在收集到的训练数据上采用KL正则化的强化学习算法对所述待强化策略进行在线优化,输出最优目标策略;所述目标为固定翼无人机达到的目标速度矢量;所述行为目标为收集数据时使用的目标。
2.根据权利要求1所述的方法,其特征在于,根据所述目标完成能力获取目标采样概率分布,包括:根据所述目标完成能力生成训练过程中的目标采样概率分布: ;其中, 为采样目标 的策略概率, 为待强化策略完成目标g的概率, 为当前被评估概率的目标, 为遍历的被评估概率的目标集合。
3.根据权利要求2所述的方法,其特征在于,采用KL正则化的强化学习算法对所述待强化策略进行在线优化,输出最优目标策略,包括:采用KL正则化的强化学习算法对所述待强化策略的期望折扣累计奖励进行优化: ;其中, 为待强化策略的期望折扣累计奖励, 为待强化策略, 为最优目标期望, 为折扣因子, 为奖励函数, 为正则化强度, 为预训练模型参数, 为固定翼飞机当前t时刻对应的动作, 为固定翼飞机当前t时刻对应的状态;取所述期望折扣累计奖励的最大值对应的目标待强化策略,作为最优目标策略输出。
4.一种同策略多目标强化学习框架的设计装置,其特征在于,用于实现权利要求1至3任一项所述方法,所述装置包括:模型构建模块,用于构建同策略多目标优化模型;所述同策略多目标优化模型包括:预训练模型与策略优化模型;预训练模块,用于所述预训练模型基于专家示范数据对当前行动策略进行优化训练,得到待强化策略;在线强化模块,在所述策略优化模型上,评估所述待强化策略的目标完成能力,根据所述目标完成能力获取目标采样概率分布,根据目标采样概率分布采样行为目标,根据采样得到的所述行为目标收集训练数据,在收集到的训练数据上采用KL正则化的强化学习算法对所述待强化策略进行在线优化,输出最优目标策略。
5.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至3中任一项所述方法的步骤。