1.一种基于强化学习的反无人机任务分配方法,其特征在于,采用强化学习与进化算法相结合的方法来解决动态的反无人机任务分配问题,包括如下步骤:步骤1,对改进的DQN算法初始化,所述改进的DQN算法是指相对于DQN算法,采用当前时刻的状态来预测Q值;步骤2,通过改进的DQN算法完成智能体的训练与优化,在智能体训练完备之后保存网络的参数;步骤3,将无人机状态信息S输入强化学习模块,通过强化学习输出决策结果次优解X,即初期的分配策略,表示为拦截装备的状态;步骤4,通过进化算法对强化学习生成的次优解进行优化,最终生成目标任务分配的最优解;步骤5,对所述的最优解进行解码,获得反无人机的任务分配方案;步骤2中所述的智能体的训练与优化通过反无人机系统MDP的决策模型进行;反无人机系统MDP的决策模型包含4个要素,分别是状态、动作、策略和奖励,元组表示为:(S,A,P,R),其中,S表示无人机的状态,状态信息为(x,y),表示无人机在网格化防区的位置;A表示智能体的动作,0表示静默,即不采取行动,1表示打击无人机;P表示状态之间的转移概率,R表示在状态S下采取不同控制动作A所能得到的即时奖赏;步骤2中智能体训练过程中与环境交互的所有信息通过step()模块实现:其输入是动作a,输出是下一时刻状态s’,当前动作的奖励r,是否终止训练done以及调试项info;step()模块主要包括三个部分:2.11,获得系统下一时刻的状态系统的状态主要是由无人机的位置组成,从防护区域的边界开始,模拟意外闯入预设区域的无人机,无人机在预设区域范围随机行动,有(0,1,2,3,4)这5种基本动作,分别表示静止,往东移动,往西移动,往北移动,往南移动;2.12,获得动作的奖励智能体在打击无人机时,无人机在射程之内,武器动作为0,则奖励值为-1;武器动作为1,则奖励值为1;无人机在射程之外,武器动作为0,则奖励值为1;武器动作为1,则奖励值为-1;2.13,获得训练的终止信号在无人机被成功击毁或者是无人机飞入预设区域跑道时,done=True;此时结束训练;否则,done=False,表示继续进行训练,直至达成终止条件;步骤2中所述的通过改进的DQN算法训练智能体具体包括如下步骤:2.21,初始化状态s,选择训练的起点,状态s是从防护区边界坐标中随机抽取的;2.22,选择动作a,智能体开始与环境进行交互;2.23,环境根据动作a做出改变,状态s发生改变,done值发生变化,并且环境给予智能体一个奖励r;2.24,将(s,a,r)放入经验池D中;检验经验池D是否储存完毕,若储存完毕则进行学习,否则继续储存;2.25,从经验池中学习并判断是否达到终止条件,未达到终止条件,则根据公式(1)进行Q值更新;2.26,采用如下公式作为损失函数更新网络;2.27,进行状态S的更新;2.28,每隔指定步数更新一次 是目标网络Q t (s,a)的参数;2.29,检测算法的终止状态与收敛情况;当达到终止条件时,算法此时优化的神经网络即为要输出的网络Q e (s t ,a t )。
2.根据权利要求1所述的基于强化学习的反无人机任务分配方法,其特征在于,所述智能体的数量与拦截装备的数量相同。
3.根据权利要求1或2中所述的基于强化学习的反无人机任务分配方法,其特征在于,步骤1中所述改进的DQN算法中Q值的公式如下:其中Q e (s t ,a t )表示估值网络在当前时刻的状态与动作中输出的Q值;s t 为当前状态;a t 为当前动作;r为当前奖励;γ表示衰减系数,用来平衡当前与未来的收益;α为学习率,代表学习最优Q值选择行为的概率;Q t (s t ,a t )表示估值网络在目标时刻的状态与动作中输出的Q值。
4.根据权利要求3中所述的基于强化学习的反无人机任务分配方法,其特征在于,步骤1中所述的对改进的DQN算法初始化包括如下步骤:1.1,初始化Q网络Q e (s,a)参数 1.2,初始化目标网络Q t (s,a)参数 1.3,初始化经验池D,容量为n。
5.根据权利要求1中所述的基于强化学习的反无人机任务分配方法,其特征在于,步骤3中所述强化学习模块的输出X为m*n阶的决策矩阵,m为来袭无人机的数量,n为武器的数量;矩阵的每一行数值都表示一个完整的决策,即若x i,j 为1,表示第j个武器打击无人机i;同时,x i,j 中的i可以看成第i个决策方案,进化算法是对多个方案进行优化。
6.根据权利要求1中所述的基于强化学习的反无人机任务分配方法,其特征在于,步骤3中所述的将无人机状态信息S输入强化学习模块,通过强化学习输出决策结果分为如下步骤:3.1,模型每隔1s输入所搜索的状态s;3.2,将状态s输入神经网络Q e (s,a),神经网络按照训练要求输出相应的动作;3.3,输出代表智能体的神经网络决策结果。
7.根据权利要求6所述的基于强化学习的反无人机任务分配方法,其特征在于,步骤4中所述的通过进化算法对强化学习生成的次优解进行优化,最终生成目标任务分配的最优解包括如下步骤:首先获得初始种群(X)并对初始种群编码,然后计算适应度,选择算子并进行交叉,判定是否进行变异,如判断值为0,则进行变异,如判断值为1,则重复上一步,从而得到新种群,最终种群进化完成,直到达到迭代次数,从而输出多个决策结果。