有效
基于DCNN和Transformer的雷达辐射源识别方法
赵志强、朱贺、潘勉、吕帅帅
杭州电子科技大学
摘要
本发明公开了一种基于DCNN和Transformer的雷达辐射源识别方法,将Transformer架构引入到雷达辐射源识别领域,并且对架构进行改进,克服了之前学习远程依赖性难题,计算两个位置之间的关联突破之前卷积神经网络的限制。采用注意力机制模型,对于多通道的数据特征提取,通过学习进入全局特征提取前的数据通道特征,学习通道依赖性,凸显特征提取后的各个通道的重要性,提高辐射源时频图的表征能力。本发明提出的方法可以对低信噪比的时频图首先进行局部特征提取,然后考虑关联位置之间的关系考虑全局特征,在信噪比的情况下,综合局部特征跟全局特征,能够有良好的识别效果。
1.基于DCNN和Transformer的雷达辐射源识别方法,其特征在于,步骤如下:S1,构建数据集;通过MATLAB仿真生成包括二相编码信号、线性调频连续波信号、Costas信号、Frank信号、多相码P1、P2、P3、P4和多时码T1、T2、T3、T4,12类别不同调制信号,信号在信噪比为-8db到8db范围内,每个信噪比下每一类调制信号样本数至少包含500个,对信号进行时频变换得到包含12种信号时频图的数据集;根据时频图样本数建立训练集和测试集:训练集和测试集比例保持在7:3;对得到的数据采用Mean均值和Std标准差的归一化的预处理方法;S2,构建雷达辐射源识别网络模型;所述的雷达辐射源识别网络模型包括多层CNN局部特征提取模块、通道注意力机制模块、Transformer和分类器;首先利用多层CNN特征提取模块对于预处理后的时频图数据进行特征提取,通过通道注意力机制层对于通道重要性进行表征,利用Transformer进行全局特征关联,最后,构造全连接层利用softmax进行分类输出;S3,通过多层CNN局部特征提取模块,提取信号时频图的局部特征;S4,对于提取到的信号时频图的局部特征,通过通道注意力机制模块动态调整输出各个通道的特征,强调关键通道输出信息;S5,通过Transformer处理经过通道注意力机制模块处理的输出特征,弥补CNN局部特征提取全局建模能力较弱的问题;S6,通过分类器,对目标分类,对Transformer模型的输出,再次使用全连接进行样本标记空间映射,将更有效的特征进行保留,最后采用softmax对网络的输出进行分类;S7,通过训练集数据训练雷达辐射源识别网络模型;S8,将测试集送入S7步骤中已训练完成的模型中进行测试。
2.根据权利要求1所述的基于DCNN和Transformer的雷达辐射源识别方法,其特征在于,S1详细步骤为:S1.1:通过MATLAB仿真生成一个包括二相编码信号、线性调频连续波信号、Costas信号、Frank信号、多相码P1、P2、P3、P4和多时码T1、T2、T3、T4,一共12种不同调制类型信号,对信号进行Choi-Williams分布时频处理,得到信号时频图数据集;根据时频图样本数建立训练集和测试集:训练集和测试集比例保持在7:3,将数据和标签对应随机打乱,将训练数据集记为D={(x i ,y k )} i∈[1,n],k∈[1,c] ,其中x i 表示第i个样本,y k 表示样本属于第k类,一共采集了c类目标,n表示样本总数;S1.2:对得到的时频图数据进行Mean均值和Std标准差的归一化,单个时频图样本表示为x raw =[x 1 ,x 2 ,x 3 …,x M ],其中M表示时频图数据中特征总数,对每个生成的训练集、测试集数据进行归一化处理;归一化后的时频图特征表示为:其中x为时频图样本输入数据,mean(x)和std(x)分别为时频图输入数据的均值和标准差;x'为mean均值和std标准差的归一化的响应;统一数据的尺度,使数据都保持在0-1之间,方便于后续的网络处理。
3.根据权利要求1所述的基于DCNN和Transformer的雷达辐射源识别方法,其特征在于,S3详细步骤为:所述的多层CNN局部特征提取模块包括四个依次连接的卷积模块;第一个卷积模块包含第一卷积层、第一批归一化层、Relu激活函数,其中卷积层采用64个3*3的卷积核,stride跟padding设置为1;第二个卷积模块包含第二卷积层、第二最大池化层、第二批归一化层、Relu激活函数,其中卷积层采用64个3*3的卷积核,stride跟padding设置为1,池化层尺寸大小设置为2*2;第三个卷积模块包含第三卷积层、第三批归一化层、Relu激活函数,其中卷积层采用128个3*3的卷积核,stride跟padding设置为1;第四个卷积模块包含第四卷积层、第四最大池化层、第二批归一化、Relu激活函数,其中卷积层采用128个3*3的卷积核,stride跟padding设置为1,池化层尺寸大小设置为2*2;批归一化采用:其中,F n (k,l)表示批归一化之前的雷达辐射源样本对应的卷积层输出中,第k个通道中的第l个元素, 即为批归一化之后的辐射源数据,α k 和β k 为可训练的对应于第k个通道的参数,ε是一个很小的数,为了防止除数为0,大小为10e-8,E(.)为求均值操作,Var(.)表示求方差操作;激活函数采用Relu函数: 为输入, 为Relu的响应输出。
4.根据权利要求3所述的基于DCNN和Transformer的雷达辐射源识别方法,其特征在于,S4详细步骤为:对于多层CNN局部特征提取模块的输出,通过一个128维的alpha向量来学习不同通道间的重要性,通过矩阵相乘,得到通道注意力机制模块的输出;通道注意力机制模块具体公式如下:其中O conv (k)表示输出Z add 中第k个通道的输出向量,α代表网络自动学习的alpha向量,O att 则代表通道注意力机制模块输出。
5.根据权利要求4所述的基于DCNN和Transformer的雷达辐射源识别方法,其特征在于,S5详细步骤为:S5.1:对S4后的输出进行切块操作,将输出特征按照32*32进行切分,进行embedding操作,每个embedding大小为32*32*128,得到4个embedding,初始化一个同样大小的token,进行全连接操作,将每个32*32*128embedding映射到一个大小128的低维中,得到5*128的输出;S5.2:加入位置编码,通过卷积层提取和通道注意力机制模块的局部特征中,并不包含位置的序列信息,采用动态学习的方式,学习位置信息;其中,P(k,l)表示第k个通道序列特征中的第l个元素,l的取值范围是[0,dmodel),表示位置编码的维度;可见每一个通道序列中的值都是由不同周期的正余弦函数的取值组合,从而产生独一的具有纹理的位置信息;S5.3:通过多头注意力机制提取全局有效特征,多头注意力机制将切块后加位置编码的128维输出,分别分成8组head,每一维特征分别乘以三个随机初始化的矩阵W q ,W k ,W V 得到Q,K,V三个矩阵,在每一组中进行self-attention,再将8组的结果进行拼接,其中每一个head i 表示为:head i =Attention(Q i ,K i ,V i )MultiHead(Q,K,V)=Concat(head 0 ,...,head 7 )WO其中d k 为输入维度数,再将head 0 到head 7 按列相连,乘以随机初始化的矩阵W 0 ,即可得到最终的全局有效特征MultiHead(Q,K,V),记为Z;S5.4:将得到的全局有效特征输入前向神经网络,通过线性变化,实现高维到低维的转换,进一步保留有效特征;再经过Relu激活函数,输出非线性结果;S5.5:对前向神经网络的输出进行归一化处理,最后的输出为
6.根据权利要求5所述的基于DCNN和Transformer的雷达辐射源识别方法,其特征在于,S6详细步骤为:所述的分类器包括全连接层和softmax层;S6.1:首先通过全连接层对输入的token序列进行处理,通过一个全连接层将归一化处理后的token序列映射到一个低维度特征dim,dim每一项公式为:i为token序列中第i个神经元,W i 为每个神经元的权重值,b i 为偏差值, 为全连接层的响应输出;S6.2:通过softmax层对 进行分类,所述激活函数softmax的数学模型表示如下:其中z j 代表第j个元素,m为类别数,p j 为激活函数softmax的响应。
7.根据权利要求6所述的基于DCNN和Transformer的雷达辐射源识别方法,其特征在于,S7详细步骤为:将预处理后训练集样本输入到雷达辐射源识别网络中训练网络,网络采用Adam算法更新网络权值;所述Adam算法如下:m←β 1m +(1-β 1 )gν←β 2 ν+(1-β 2 )g2其中g表示为损失函数L(θ)的梯度;θ表示为迭代权重; 表示梯度算子;m表示初始化为0的g的一阶矩估计;ν表示为初始化为0的g的二阶矩估计;β 1 为一阶矩估计的指数衰减率,取值为0.9;β 2 为二阶矩估计的指数衰减率,取值为0.9;T表示转置操作;α为学习率,初始设置为0.001;ε为平滑常数,防止除数0,取值为10e-8;采用交叉熵损失函数;为了避免过拟合的发生以防止网络的泛化能力降低;所述交叉熵损失函数表示如下:其中H(p,q)表示交叉熵损失函数;p(x)表示样本的真实分布;q(x)表示模型所预测的分布;交叉熵损失函数越小,表示样本的真实分布与模型所预测的分布越接近;引入早停机制,以测试准确率作为标准,引入学习率衰减,设置最小学习率为0;设置最大训练轮数为100轮,batch_size大小为32;以测试准确率为标准,保存识别准确率最高的网络模型。





