有效
一种雷达空-时-频-能多域联合智能主动抗干扰方法
袁野、杨涛、程宇、杨成新、方学力、易伟、孔令讲
电子科技大学
摘要
本发明公开了一种雷达空‑时‑频‑能多域联合智能主动抗干扰方法,首先建立雷达和多干扰机环境下的对抗场景,然后梳理雷达和干扰机双边的模型参数和工作模式,确定评价指标完成对雷达调度策略的评估,再将问题转化为马尔可夫决策过程,用Q学习来求解雷达多域资源调度的最优策略。本发明的方法得到的优化策略自适应性强,模型可扩展性好,可根据实际需要调度的参数资源进行调整,通过协同调控雷达多个域之间的发射参数,相比于现有单域资源调度抗干扰方法,可实现在提高任务性能的同时,显著增强雷达主动抗干扰的能力,挖掘雷达潜在的任务性能,同时利用Q学习来优化雷达节点多域联合主动抗干扰策略,提高雷达电子对抗环境下的生存能力。
1.一种雷达空-时-频-能多域联合智能主动抗干扰方法,具体步骤如下:步骤S1、建立监视雷达和多干扰机环境下的对抗场景,确定雷达和干扰机个数以及对抗关系;步骤S2、梳理监视雷达具体可联合调度的资源参数;步骤S3、梳理干扰机的时变参数,建立干扰机截获机制;步骤S4、初始化雷达系统和干扰机参数,计算检测性能和低截获性能;步骤S5、根据检测概率,低截获性能和截获惩罚构建奖励,并将问题转化为马尔可夫决策过程;步骤S6、使用Q学习算法对该马尔可夫决策过程求解,得到优化后的调度策略。
2.根据权利要求1所述的一种雷达空-时-频-能多域联合智能主动抗干扰方法,其特征在于,所述步骤S1具体如下:基于脉冲压缩的频率捷变雷达周期性的扫描目标空域中所有波位,在空域中有n个干扰机进行干扰,确定雷达和干扰机之间为对抗关系,在满足检测性能的前提下,雷达动态调度自身资源躲避干扰机的干扰。
3.根据权利要求2所述的一种雷达空-时-频-能多域联合智能主动抗干扰方法,其特征在于,所述步骤S2具体如下:将雷达扫描每个波位的用时记为调度间隔SI,在每一调度间隔内,雷达的发射参数保持不变,雷达使用所选参数对外探测,根据探测结果计算检测性能和低截获性能;假设将目标空域切分成p个波位,并对切分的波位进行编号,则雷达需耗时p个调度间隔完成一轮完整的周期扫描;在每一调度间隔内,雷达从波位集合Θ中选择波位: (1);雷达从频率集合F中选择频率,集合中共有q个可用频率: (2);对总频段进行等间隔划分,则第t个频率和第t - 1个频率之间的关系可用式(3)表示: (3);其中,δf表示固定的频率间隔步长;雷达功率可选集合P见式(4),功率有u个可选数值,驻留时间可选集合T d 见式(5),驻留时间有v个可选数值: (4); (5)。
4.根据权利要求3所述的一种雷达空-时-频-能多域联合智能主动抗干扰方法,其特征在于,所述步骤S3具体如下:干扰机通过ELINT系统事先获知雷达可能会使用到的所有频率,干扰机随机扫描频率集合中所有q个频点,瞬时覆盖频段在固定的时隙T mf 更新,当干扰机扫描完所有q个频点,就重新开始新一轮的周期扫描;干扰机的空间位置是时变的,Θ j 表示干扰机所在波位,R j 表示干扰机相距雷达的距离,给定一时刻k,干扰机的位置可表示为(Θ j k ,R j k ),当干扰机截获到雷达信号,进行噪声压制干扰,否则,干扰机保持静默来节省能量损耗。
5.根据权利要求4所述的一种雷达空-时-频-能多域联合智能主动抗干扰方法,其特征在于,所述步骤S4中,初始化雷达系统和干扰机的基本参数,并对雷达性能指标进行计算,具体如下:S41、计算检测概率P d ;如果雷达信号没有被干扰,根据雷达方程,雷达接收机所得信噪比 为: (6);其中, 表示雷达选择的功率,G r 表示雷达波束主瓣增益, λ表示雷达信号波长,σ表示目标散射截面积,R表示雷达与目标间的距离,L表示雷达损耗,其单位为dB,K=1.38*10 -23 ,表示玻尔兹曼常数,T e 表示有效噪声温度,F r 表示接收机内部噪声系数,B r 表示雷达工作带宽;若雷达受到干扰机干扰,则雷达接收到的干扰功率 为: (7);其中, 是角度θ的函数,表征干扰能量从雷达波束不同方位角进行干扰时雷达的接收波束增益;假设当干扰从雷达波束主瓣进入, =G r ,当从旁瓣进入时, =G sav ,G sav 表示雷达天线的平均旁瓣增益,P j 表示干扰机发射信号功率,G j 表示干扰机波束增益,则雷达接收机所得信干噪比 为: (8);无干扰情况下,首先对回波做脉冲压缩,计算脉冲压缩后的信噪比 : (9);其中, 表示雷达的时间带宽积,τ表示雷达脉冲宽度,脉冲压缩这一过程将原脉冲的信噪比提高D倍;雷达在每个波位都会驻留一个驻留时间T di ,驻留时间决定着当前波位可被积累的脉冲数,脉冲数为: (10);其中,符号 表示向下取整,T r 表示脉冲重复间隔;重写 为 ,计算非相干积累n p 个脉冲后的积累信噪比 : (11);在式(9)到式(11)计算的基础上,求取检测概率: (12);其中,Q表示Marcum Q函数,P fa 表示虚警率;可对式(12)做近似计算: (13);有干扰情况下,后续计算过程和无干扰情况相近,将无干扰下的 用 替换,用式(8)到式(11)计算即可;S42、计算低截获性能P ni ;计算雷达每次调度的低截获性能,假定单个脉冲截获概率P I 可表示为: (14);其中,P I 表示单脉冲被截获的概率,P I_f 表示频域被截获的概率,P I_e 表示能域被截获的概率,P I_t 表示时域被截获的概率,P I_s 表示空域被截获的概率,P I_ρ 表示极化域被截获的概率;截获接收机工作在扫频模式,频域被截获的概率等价于雷达信号频段落入到截获机瞬时带宽的概率,因此P I_f 为: (15);其中,B ins 表示雷达截获机瞬时截获带宽,B total 表示雷达总的频段范围;假设截获接收机始终处于接收状态,则时域被截获概率在数值上等于单位时间内雷达辐射信号的时间,即占空比: (16);能域截获概率P I_e 即截获接收机检测概率,若雷达信号高于截获接收机输出端的检测门限,将以概率P I_e 被成功截获: (17);其中,γ j 表示极化失配因子,B j 表示干扰机干扰信号带宽,L j 表示干扰机截获损耗,F j 表示干扰机截获接收机内部噪声系数;假设截获接收机具备旁瓣侦收的能力,即可全向接收雷达脉冲,则P I_s =1,且暂不考虑极化域的因素,记P I_ρ =1,则式(14)简化为: (18);定义最少截获脉冲数n least =35,表征截获接收机至少要连续截获35个雷达脉冲,才能记为截获成功;则在这一基础上,截获少于35个脉冲的概率可定义为多脉冲体制下不被截获的概率P ni ,用P ni 来衡量雷达的低截获性能: (19);其中,ℂ表示组合数。
6.根据权利要求5所述的一种雷达空-时-频-能多域联合智能主动抗干扰方法,其特征在于,所述步骤S5具体如下:雷达资源调度问题转化为马尔可夫决策过程,雷达在状态s i 下选择一个动作a i ,完成状态转移至s i+1 ,干扰环境根据a i 和s i+1 反馈一个即时奖励r(s i+1 , a i );首先定义雷达状态,雷达需在一个扫描周期内覆盖空域所有波位,假设每个波位的扫描需要用时一个调度间隔SI,可定义状态s为调度间隔的序列号: (20);其中, 表示状态的集合, 表示第i个状态,每过一个调度间隔,状态s加1,当开始新的一轮扫描周期时,重置状态s为1;在每个调度间隔,雷达从动作集A中选择一个动作a i 完成雷达资源的动态管理,雷达的动作由波位、频率、功率、驻留时间组成,且同一周期内,波位不可被重复选择: (21);当雷达按照所选动作的参数组合完成一个波位的探测后,依据探测的结果,干扰环境会反馈一个即时的奖励r;奖励可以量化本次雷达调度的有效性,奖励由三部分组成,即探测奖励 ,低截获奖励 和截获惩罚 ;如果雷达信号被同时被多个干扰机截获,多个干扰机的截获惩罚需叠加,见式(26): (22); (23); (24); (25); (26);每次动作都会得到该动作对应的即时奖励r,将一个扫描周期的即时奖励累加起来,则得到该周期下总的累积奖励: (27)。
7.根据权利要求6所述的一种雷达空-时-频-能多域联合智能主动抗干扰方法,其特征在于,所述步骤S6具体如下:Q学习用ε-贪婪策略π来选取动作: (28);其中,ε表示衰减式随机概率,且 ,ε-贪婪策略以1-ε的概率贪婪的选择目前认为是最大行为价值的动作,而以ε的概率随机的从所有m个可选动作中选择动作 : (29);其中,Q表示强化学习中的状态行为值,再用贪婪策略μ来更新Q表格: (30);然后根据一次动作交互所得元组数据(s i , a i , s i+1 , a i+1 , r)按下式更新Q值: (31);其中, 表示学习速率, 表示衰减因子;随着Q表格的更新,在动作空间完成足够探索后,Q表格和对应的ε-贪婪策略趋于收敛,得到这一决策过程的最优动作策略,也即得到调度问题的最优解。





