1.一种基于无模型强化学习的多阶段灵巧噪声干扰方法,其特征在于,包括以下步骤:S1、将多阶段干扰功率分配问题建模成未知环境模型的构建马尔科夫决策过程:具有自卫系统的目标飞机和具有FCR的飞机在各阶段不断进行对抗,直到目标飞机被锁定或者目标飞机成功逃脱则对抗结束;自卫干扰系统包括干扰机和RWR;在每个阶段,干扰机首先将接收到FCR发射出的波形进行波形特征提取,辨别出FCR的当前工作模式s k ∈S,S为FCR可能工作的模式,k表示阶段序号;然后干扰机选择一个与干扰功率相对应的干扰动作a k ∈Α来实施灵巧噪声干扰,Α为可能的干扰动作集合;最后,经历一个阶段后,自卫干扰系统将得到第k阶段的奖励t k 并且FCR切换到下一工作模式s k+1 ,t k 为FCR在第k阶段所消耗的时间,s表示当前FCR的工作模式,a表示当前的干扰动作;S2、采用FCR的搜索-锁定时间作为灵巧噪声干扰性能指标;S3、采用元组<S,A,Θ,ψ,δ>表示多级干扰功率分配问题的强化学习框架;其中,S为有限状态空间,对应于FCR的工作模式;A为有限动作空间,对应于干扰机可行的干扰动作空间;Θ为状态转移函数,对应于FCR不同工作模式之间的切换;ψ为奖励函数,对应于在当前状态FCR的消耗时间;δ为折扣因子,对应于干扰机对未来奖励的评估;S4、采用Q-learning算法求解多阶段干扰功率的最优分配。
2.根据权利要求1所述的一种基于无模型强化学习的多阶段灵巧噪声干扰方法,其特征在于,步骤S4具体为:S41、确定学习因子序列{α n ∈(0,1)}和探索因子序列{ξ n ∈(0,1)};其中,α n 表示学习因子,ξ n 表示探索因子;S42、初始化Q-table,令Q(s,a)=0;其中;S43、当目标飞机没有被FCR锁定时,在状态s依据Q-table以ξ n 的概率选择当前最优的干扰动作;否则结束;S44、评估当前干扰动作,得到FCR的搜索-锁定时间,以及FCR的下一工作模式;S45、根据步骤S43选择的干扰动作以及步骤S44得到的FCR消耗的时间与FCR的下一工作模式,更新Q-table;S46、将FCR切换至步骤S44得到的下一工作模式,若目标没有被FCR锁定,则返回步骤S3;否则结束当前回合,执行步骤S47;S47、若达到设定的回合数,则结束;否则返回步骤S3。
3.根据权利要求2所述的一种基于无模型强化学习的多阶段灵巧噪声干扰方法,其特征在于,步骤S44所述FCR的搜索-锁定时间,具体为:在当前干扰动作下,FCR在其当前工作模式所持续的时间。
4.根据权利要求2所述的一种基于无模型强化学习的多阶段灵巧噪声干扰方法,其特征在于,步骤S43为:当目标飞机没有被FCR锁定时,在状态s依据Q-table以1-ξ n 的概率随机选择干扰动作;否则结束。
5.根据权利要求2所述的一种基于无模型强化学习的多阶段灵巧噪声干扰方法,其特征在于,步骤S45所述更新Q-table,表达式如下:其中,s′表示FCR的下一工作模式,a′表示下一干扰动作。
6.根据权利要求4或5所述的一种基于无模型强化学习的多阶段灵巧噪声干扰方法,其特征在于,a′通过步骤S43获得。