1.一种基于强化学习的无人机知识模型组合的参数寻优方法,其特征在于,所述方法包括:获取待优化的无人机知识模型组合和历史时刻无人机知识模型的参数样本;所述无人机知识模型组合对应的超参数作为组合动作;所述无人机知识模型组合中的无人机知识模型对应的超参数作为原子动作;对所述组合动作进行结构化分解,得到多个一维原子动作;利用无人机知识模型组合在预先设置的周期内对目标区域执行任务,得到当前时刻无人机知识模型组合的环境及时反馈值;根据所述环境及时反馈值和历史时刻无人机知识模型的参数样本构建组合动作损失函数,利用所述组合动作损失函数对预先构建的组合动作神经网络进行训练,得到训练好的组合动作评价网络;利用多个原子动作对应的动作评价值的差值构建原子动作损失函数,根据所述原子动作损失函数对预先构建的原子动作神经网络进行训练,得到初始原子动作评价网络;根据预先设置的训练约束条件、训练好的组合动作网络的输出和初始原子动作评价网络的输出对所述初始原子动作评价网络进行训练,得到训练好的原子动作评价网络;利用所述训练好的原子动作评价网络对多个一维原子动作序列进行评价,得到每个原子动作的评价值;根据所述每个原子动作的评价值对预先构建的参数优化网络进行训练,得到训练好的参数优化网络;利用所述训练好的参数优化网络对所述待优化的无人机知识模型组合的参数进行优化。
2.根据权利要求1所述的方法,其特征在于,所述组合动作损失函数包括当前时刻组合动作损失函数和历史时刻组合动作损失函数;所述历史时刻无人机知识模型的参数样本中包含当前时刻之前的所有时刻无人机知识模型组合在不同态势信息下对应的组合动作的评价值;根据所述环境及时反馈值和历史时刻无人机知识模型的参数样本构建组合动作损失函数,利用所述组合动作损失函数对预先构建的组合动作网络进行训练,得到训练好的组合动作网络,包括:根据所述环境及时反馈值和历史时刻无人机知识模型组合在不同态势信息下对应的组合动作的评价值构建当前时刻组合动作损失函数;所述评价值包含目标值和估计值;根据所述环境及时反馈值和历史时刻无人机知识模型的参数样本构建历史时刻组合动作损失函数。
3.根据权利要求2所述的方法,其特征在于,根据所述环境及时反馈值和历史时刻无人机知识模型组合在不同态势信息下对应的组合动作的评价值构建当前时刻组合动作损失函数,包括:根据所述环境及时反馈值和历史时刻无人机知识模型组合在不同态势信息下对应的组合动作的评价值构建当前时刻组合动作损失函数为其中, 表示基于贝尔曼公式评价值的误差期望值, 表示环境及时反馈值, 表示损失因子, 表示在 t+1 时刻无人机知识模型组合处于态势信息 时的对应的组合动作的目标值, 表示对态势信息 的编码, 表示时序状态编码 下的策略,即所述时序状态编码下采取相关动作的相应概率值, 表示在 t 时刻无人机知识模型组合处于态势信息 时的对应的组合动作 的估计值。
4.根据权利要求3所述的方法,其特征在于,根据所述环境及时反馈值和历史时刻无人机知识模型的参数样本构建历史时刻组合动作损失函数,包括:根据所述环境及时反馈值和历史时刻无人机知识模型的参数样本构建历史时刻组合动作损失函数为其中, m 表示参数样本的数量, 表示在样本 j+1 中无人机知识模型组合处于态势信息 时的对应的组合动作 的目标值, 表示在样本 j 中无人机知识模型组合处于态势信息 时的对应的组合动作 的估计值。
5.根据权利要求4所述的方法,其特征在于,利用多个原子动作对应的动作评价值的差值构建原子动作损失函数,包括:利用多个原子动作对应的动作评价值的差值构建原子动作损失函数为其中, 表示前一个原子动作Q值与其后原子动作差值和的期望值,Q值表示状态 u 下采用动作a的评价值,N表示原子动作个数, 表示原子动作的序号, 表示第k个原子动作的状态值, 表示第k个原子动作, 表示第k个原子动作的Q值。
6.根据权利要求5所述的方法,其特征在于,所述预先设置的训练约束条件为 ,其中, 表示在 t 时刻处于态势信息 时的对应的组合动作 的评价值, 表示处于态势信息 时的第N-1个原子动作的状态值对应的原子动作 的评价值。
7.根据权利要求6所述的方法,其特征在于,根据预先设置的训练约束条件、训练好的组合动作网络的输出和初始原子动作评价网络的输出对所述初始原子动作评价网络进行训练,得到训练好的原子动作评价网络,包括:根据预先设置的训练约束条件、训练好的组合动作网络的输出和初始原子动作评价网络的输出构建组合动作和原子动作评价值之间的混合损失函数;利用所述混合损失函数对所述初始原子动作评价网络进行训练,得到训练好的原子动作评价网络。
8.根据权利要求7所述的方法,其特征在于,根据预先设置的训练约束条件、训练好的组合动作网络的输出和初始原子动作评价网络的输出构建组合动作和原子动作评价值之间的混合损失函数,包括:根据预先设置的训练约束条件、训练好的组合动作网络的输出和初始原子动作评价网络的输出构建组合动作和原子动作评价值之间的混合损失函数为其中, 表示处于态势信息 时的对应的组合动作 的评价值, 表示对态势信息 的编码, 表示处于态势信息 时的第N个原子动作的状态值对应的原子动作 的评价值, 表示对第N个原子动作的状态值的编码。
9.根据权利要求8所述的方法,其特征在于,根据所述每个原子动作的评价值对预先构建的参数优化网络进行训练的损失函数为其中, 表示参数优化网络中的可学习参数, 表示第k个原子动作的状态值的编码。