1.一种基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,所述方法包括:提取无人机的目标特征数据;所述目标特征数据是无人机视野中目标无人机的连续历史数据拼接后得到的;根据无人机与目标无人机的距离,对所述目标特征数据进行稀疏化处理,生成全局表征;构建马尔科夫博弈模型;所述马尔科夫博弈模型的动作空间包括:反制动作和保持观察动作,所述动作空间的输入是所述全局表征,以此计算当前无人机状态下执行各个动作的概率分布,所述马尔科夫博弈模型的策略网络根据所述概率分布输出各个动作的动作概率;所述马尔科夫博弈模型的奖励函数包括无人机选择目标的奖励以及状态转移代价;将所述奖励函数定义为贝叶斯优化的目标函数,利用高斯过程作为代理模型对所述目标函数进行概率建模,通过迭代求解得到最优的奖励函数输出值;根据最优的奖励函数输出值,输出马尔科夫博弈模型的无人机目标选择结果;所述提取无人机的目标特征数据,包括:连续提取无人机的连续q步的目标无人机的特征数据,以及连续 步的目标无人机的特征数据变化值;按照q步依次对所述特征数据和所述特征数据变化值进行求和,得到数据拼接值;将所述数据拼接值输入Softmax函数归一化处理,得到无人机的目标特征数据。
2.根据权利要求1所述的基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,根据无人机与目标无人机的距离,对所述目标特征数据进行稀疏化处理,生成全局表征,包括:根据无人机与目标无人机的距离,对所述目标特征数据进行稀疏化处理,生成全局表征为:其中, 表示目标特征数据, , 表示目标无人机i的目标特征, 表示所有目标无人机重要度的稀疏注意力掩码向量。
3.根据权利要求2所述的基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,计算当前无人机状态下执行各个动作的概率分布,包括:计算当前无人机状态下执行各个动作的概率分布为:其中, 是权重矩阵, 是偏置向量, 表示无人机当前状态 、动作空间的动作 时的概率分布。
4.根据权利要求3所述的基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,所述状态转移代价为:其中, 表示状态转移代价, 表示执行动作 的运动距离代价, 表示无人机与目标无人机的距离, 是无人机反制目标无人机的期望距离, 表示执行动作 的分布均匀性代价, 表示当前时刻无人机所选的目标周围的友方无人机数量, 为无人机视野中友方无人机数量, 表示无人机视野中待反制无人机的数量, 表示目标威胁代价, 表示无人机所选目标无人机的威胁值, 表示权重参数。
5.根据权利要求4所述的基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,所述无人机选择目标的奖励为:其中, 为目标的威胁影响值, 为目标距离影响值, 为目标周围友方无人机数量影响值, 为威胁值重要性参数, 为目标距离重要性参数, 为目标周围友方数量的重要性参数, 为控制状态转移代价 的影响程度。
6.根据权利要求5所述的基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,所述奖励函数为:其中, 表示奖励函数,T表示累计时间, 表示期望。
7.根据权利要求6所述的基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,利用高斯过程作为代理模型对所述目标函数进行概率建模,包括:将所述目标函数改写为服从高斯分布为:其中, 是均值函数, 表示核函数, 表示权重参数组合, 表示信号方差, 是长度尺度参数。
8.根据权利要求7所述的基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,通过迭代求解得到最优的奖励函数输出值,包括:每次迭代中,使用新的数据点更新高斯分布的后验分布为:其中, 是预测均值, D 表示训练集输入矩阵, 表示正态分布, 是预测方差;构建采集函数为:其中, 表示期望, 是当前已知的最大目标函数值, 和 分别是标准正态分布的累积分布函数和概率密度函数, 表示期望改进;根据采集函数最大,选择下一组候选权重组合 :当优化过程结束时,输出使目标函数值最大的权重组合,否则返回后验分布更新: 。
9.一种基于马尔科夫博弈与贝叶斯优化的无人机目标选择装置,用于实现权利要求1至8任一项所述的基于马尔科夫博弈与贝叶斯优化的无人机目标选择方法,其特征在于,所述装置包括:数据提取模块,用于提取无人机的目标特征数据;所述目标特征数据是无人机视野中目标无人机的连续历史数据拼接后得到的;全局表征模块,用于根据无人机与目标无人机的距离,对所述目标特征数据进行稀疏化处理,生成全局表征;模型构建模块,用于构建马尔科夫博弈模型;所述马尔科夫博弈模型的动作空间包括:反制动作和保持观察动作,所述动作空间的输入是所述全局表征,以此计算当前无人机状态下执行各个动作的概率分布,所述马尔科夫博弈模型的策略网络根据所述概率分布输出各个动作的动作概率;所述马尔科夫博弈模型的奖励函数包括无人机选择目标的奖励以及状态转移代价;优化模块,用于将所述奖励函数定义为贝叶斯优化的目标函数,利用高斯过程作为代理模型对所述目标函数进行概率建模,通过迭代求解得到最优的奖励函数输出值;输出模块,用于根据最优的奖励函数输出值,输出马尔科夫博弈模型的无人机目标选择结果。