有效
一种基于模糊强化学习的捷变频雷达时频域联合干扰方法
余显祥、甘霖川、熊奎、李世龙、廖茂森、崔国龙、孔令讲、杨晓波
电子科技大学
摘要
本发明公开了一种基于模糊强化学习的捷变频雷达时频域联合干扰方法,首先根据雷达信号处理流程,建立目标回波模型和干扰信号模型,将干扰机视为一个智能体,并将干扰机时频域联合干扰过程建模为广义马尔可夫决策过程,得到状态价值函数,利用提出的时域模糊Q学习算法和频域Q学习算法联合求解,最后得到干扰机干扰时间、载频选择策略。本发明的方法通过将干扰过程建模为广义马尔科夫决策过程,在频域中干扰机载频的选择视为动作,雷达载频视为状态,在时域中干扰机干扰时长的选择视为动作,每一条模糊规则视为状态,将时域推理出的干扰时长和雷达脉冲重复时间的相关熵和频域干扰JNSR乘积作为联合奖励函数,实现时频域联合干扰效果,有效实施干扰。
1.一种基于模糊强化学习的捷变频雷达时频域联合干扰方法,具体步骤如下:S1、根据雷达信号处理流程,建立目标回波模型和干扰信号模型;S2、将干扰机视为一个智能体,将干扰机干扰捷变频雷达过程建模为广义马尔可夫决策过程,分别得到频域Q学习的状态价值函数和时域模糊Q学习的状态价值函数;S3、利用智能体时域模糊Q学习算法和频域Q学习算法求解步骤S2中的广义马尔科夫决策问题,得到干扰机干扰时长选择策略和干扰机频域选择策略,保证在雷达频点发生变化后,干扰机能在时频域实现联合干扰。
2.根据权利要求1所述的一种基于模糊强化学习的捷变频雷达时频域联合干扰方法,其特征在于,所述步骤S1具体如下:设定雷达的发射信号在脉间进行载频捷变,一个脉冲串的脉冲数为 ; 表示雷达发射脉冲可选的载频集合, 表示雷达发射脉冲可选的载频总数且设定任意两个可选载频点之间不重叠;其中, 中的第 个元素表示为 , 表示第 个元素的频率值选择; 表示第 个元素的频率值选择; 表示固定的频率步进值,设定雷达带宽为 ;压制干扰信号带宽为 ;二者关系为 ,雷达的发射脉冲串信号 表达式如下: (1);其中, 表示时刻, 表示脉冲重复周期, 表示雷达的第 个脉冲的载频, 表示单位幅度的线性调频信号;雷达的发射信号对目标进行照射,产生目标回波,则将雷达在第 个脉冲处受到干扰和噪声影响后的回波信号 表达式如下: (2);其中, 表示时延, 表示雷达与目标在第 个脉冲时的径向距离, 表示电磁波的传播速度, 表示多普勒频移, 表示一个零均值,功率为 的高斯白噪声, 表示单位干扰信号, 表示干扰信号在空间中传播造成的幅值改变; 表示一个包含了传播效应以及目标散射的参数,其振幅表达式如下: (3);其中, 表示雷达的第 个脉冲在雷达接收机处的接收功率, 表示雷达发射功率, 分别表示雷达发射天线增益和接收天线增益, 表示信号波长, 表示目标散射截面RCS;设定干扰机作为智能体在时域经过模糊强化学习生成干扰时长策略;将测量得到的脉冲重复周期PRT输入模糊推理系统后产生误差更小的脉冲重复周期输出值即干扰机干扰时长,作为时域全局动作选择;设定干扰机作为智能体在频域经过强化学习生成策略对雷达信号进行频域干扰, 表示干扰信号可选载频集;其中, 表示干扰信号可选的载频数目, 中的第 个元素表示为 , 表示固定的干扰频率步进值,干扰载频以随机或者按照一定的策略从 中选择,设定干扰的跳频范围能覆盖雷达系统所有可能的频段;雷达接收到干扰信号的幅度表达式如下: (4);其中, 表示雷达接收机处的干扰功率, 表示干扰发射功率, 表示干扰载频, 表示干扰发射天线增益, 表示雷达接收天线增益,干扰机对雷达的干扰概率 表达式如下: (5);其中, 和 分别表示在第 个脉冲时干扰机载频为 的中放带宽和雷达载频为 的中放带宽;将干扰机在第 个脉冲的干噪信比JNSR表达式如下: (6)。
3.根据权利要求1所述的一种基于模糊强化学习的捷变频雷达时频域联合干扰方法,其特征在于,所述步骤S2具体如下:S21、建立广义马尔科夫决策过程;设定将干扰机视为一个智能体,将干扰雷达过程建模为广义马尔科夫决策过程;时域五元组 表示,其在时域中具体定义如下:(1)智能体集 :由干扰机构成该智能体集 ;(2)动作集 :由经过模糊推理系统后,解模糊产生的干扰机干扰时长选择构成动作集 ;干扰机在第 时间步的动作 用发射的第 个脉冲的脉冲重复周期表示,即 ;(3)状态集 :模糊系统规则库中每一条规则构成状态集 ;(4)状态转移概率 : 表示干扰机从状态 时执行动作 ,状态转移到 的转移概率,表达式如下: (7);其中, 视为未知的;(5)奖励集 :将干扰机由模糊推理产生的干扰时长和雷达脉冲重复周期视为随机变量,引入相关熵的概念来设计奖励集 ,具体设计表达式如下: (8);其中, 表示正定核的带宽; 表示干扰机发射信号在时域内的覆盖范围; 表示雷达信号在时域内的覆盖范围;在实际过程中, 表示用具体数据量来估算两个变量之间的相关熵;频域内广义马尔可夫模型五元组 在频域中具体定义如下:(1)智能体集 :由干扰机构成该智能体集 ;(2)动作集 :所有干扰机的可选载频构成动作集 ;干扰机在第 时间步的动作 用发射的第 个脉冲的载频表示,即 ;(3)状态集 :雷达的所有可选载频构成状态集 ;雷达在第 时间步的状态 用干扰的载频表示,即 ;(4)状态转移概率 : 表示干扰机从状态 时执行动作 ,状态转移到 的转移概率,表达式如下: (9);其中, 视为未知的;(5)奖励集 :由干扰机干扰雷达脉冲的JNSR构成奖励集 ;干扰机在第 个时间步的奖励表示为 , 由式(6)得到;S22、得到状态动作价值函数;设定智能体在时域中产生的状态价值函数 表达式如下: (10);其中, 表示传递给模糊推理系统的输入, 的表达式如下: (11);其中, 表示模糊推理系统中针对规则库中 条规则的解模糊方法, 表示为模糊集合 的隶属度,利用模糊Q算法生成的时域全局最优动作价值函数 表达式如下: (12);其中, 表示模糊推理系统规则的数量, 表示对应于模糊变量的模糊集,计算出的时间误差 表达式如下: (13);其中, 表示 时刻的回报值, 表示折扣率; 函数的更新表达式如下: (14);其中, 表示在 时刻给定规则 和智能体行为 下的关联 函数, 表示在 时刻给定规则 和智能体行为 下的关联 函数, 表示学习率;在频域中设定智能体得到的最优策略 表达式如下: (15);其中, 表示状态动作价值函数,即Q函数,定义表达式如下: (16);其中, 表示求数学期望, 表示干扰机在第 个时间步下的奖励, 表示折扣率, 表示第 个时间步后第 个时间步, 表示由折扣率得到的加权值, 表示第 时间步时的折后收益,由未来收益进行 加权后求和得到。
4.根据权利要求3所述的一种基于模糊强化学习的捷变频雷达时频域联合干扰方法,其特征在于,所述步骤S3中,时域模糊Q学习和频域Q学习联合干扰算法求解流程具体如下:S31、令 ,初始化时域动作集 ,时域状态集 ,时域折扣率 ,时域学习率 ;初始化模糊推理系统,确定输入输出变量个数、模糊标签个数及隶属度函数;初始化频域动作集 ,频域状态集 ,频域折扣率 ,频域学习率 ;其中,学习率 ,其值随着迭代的进行而减小;S32、设定共训练 个相参处理间隔CPI,每一个CPI视为一次迭代,在第 次迭代开始时,随机初始化初始时域动作 ,频域动作 ,雷达初始载频 ,获得时域初始状态 ,频域初始状态 ;S33、对于每一个CPI中的每一个脉冲 ,在时域根据 贪婪策略为每条规则选择动作 , ;在频域根据 贪婪策略选择动作 , ;S34、从环境中感知雷达信号脉冲重复周期为 ,将其作为输入送入模糊推理系统推理出时域全局动作选择 ,从环境中感知雷达信号载频为 ;S35、综合时域全局动作选择 、 和 ,频域 、 和 ,计算得到时频域联合奖励 , ;分别得到新的时域输入值 和频域状态 ;其中, 表示乘法运算;S36、分别更新智能体的时域 函数 和频域 函数 ; (17); (18);其中, 分别表示 ;S37、更新状态 , ,当 时,返回步骤S33,否则执行步骤S38;S38、令 ,若 ,返回步骤S34,否则结束执行算法;干扰机在每一次对雷达脉冲进行干扰时,输出时频域干扰策略选择,最终实现时频域联合干扰。







