1.一种基于多路卷积网络的端到端语音识别方法,其特征在于,包括如下步骤:步骤1:通过重采样的方式将所有语音数据的采样率全部转化为aHz;wav=resampel(wav,a)步骤2:对重采样后的语音数据wav进行语音预处理;采用Fbank的输出模式;第一步为预加重处理,将语音信号通过一个高通滤波器对语音信号中低频波段进行滤波;第二步将通过高通滤波器的语音信号进行分帧处理,把不定长的音频切分成固定长度的小段,得到分帧后的语音信号,然后设置一个滑动汉明窗函数对这些分帧语音信号进行傅里叶变换,将语音数据从时域信号转变成频域信号,最后将获取的频域信号通过对数梅尔谱滤波完成Fbank的计算;wav_frame=hamming(wav,10ms)wav_data=fft(wav_frame)wav Fbank =log_mel(wav_data)步骤3:经过步骤2对语音数据进行Fbank处理后的得到一个频谱特征为80维的语音数据wav Fbank [batch_size,wav_input,80],其中barch_size表示每批处理的数据量大小,wav_input表示输入的语音长度;将所有的语音数据都进行长度填充,使wav_input的维度达到200:wav_data′[batch_size,200,80]=padding(wav_data[batch_size,wav_input,80])步骤4:将步骤3得到的语音数据输入到多路卷积网络MCNN中;语音数据分别输入到三个通道,三个通道的结构相同;先进入第一层二维卷积CNN层中,其中每个卷积层都附带一个批次归一化BatchNorm2d和Relu激活函数,每个CNN都有16个滤波器组,每个滤波器内核大小为3*3,步长为1;第一层二维卷积CNN层输出之后再输入到第二层与第一层完全相同的二维卷积层中,再输入2维最大池化层Maxpool,接下来输入失活率为0.3的Dropout层,语音数据的参数变为[1,100,40,16],四个参数中第一个为bitchsize大小,第二个为音频长度,第三个为音频的特征维度,第四个为卷积层的滤波器大小;然后继续输入第三层Conv2D二维卷积层中,相比第一层只改变卷积层中滤波器组的数量为32,输出语音数据的参数变为[1,50,20,32];再经过两个卷积层后,最后进入第六层Conv2D二维卷积层中,相比第一层只改变卷积层中滤波器组的数量为64个,输出语音数据的参数为[1,25,10,64];最后进入reshape层中重新合并语音数据wav_data[1,25,640];wav_data′ i =Maxpool(BatchNorm2d(Relu(Conv2D(wav_data′)),epsolon=0.0002),pool_size=[2,2])wav_data i =reshape(1,25,640)(wav_data′ i )i=1,2,3表示3个通道;步骤5:将三个通道输出的语音数据进行合并Merge操作,保持输入的语音长度维度不变,将频谱特征的维度进行合并输出,再进入全连接层FC中,第一层全连接层Dense1的input=1920、output=1024,第二层全连接层Dense2的input=1024,output=512,第三层全连接层Dense3的input=512、output=320,其中每两个全连接层之间都附带一个批次归一化BatchNorm2d和Relu激活函数,最终输出wav_data″[1,25,320];wav_data″=FC(Merge(wav_data 1 ,wav_data 2 ,wav_data 3 ))步骤6:构建基于Transformer模型的语音识别网络,包括编码器和解码器,其中编码器和解码器都由多头注意力机制MHA实现;编码器和解码器均由一个多头注意力机制和一个位置前馈网络FFN模块组成,在每个子层后都使用残差连接和层归一化;将经过多路卷积网络MCNN层输出的数据传入Transformer模型中,其中编码器会将输入的语音数据wav″ data =(X 1 ,X 2 ,…,X T )通过多头注意力机制映射到隐空间状态(h 1 ,h 2 ,…,h N );然后解码器通过提供的文本标签label(Y 1 ,Y 2 ,…,Y L )联合编码器层输出隐空间状态(h 1 ,h 2 ,…,h N )解码,最终预测得到目标序列pre_label T (Y 1 ,Y 2 ,…,Y L );wav_data″′(h 1 ,h 2 ,…,h N )=Encoder(X 1 ,X 2 ,…,X T )pre_label T (Y 1 ,Y 2 ,…,Y L )=Decoder((Y 1 ,Y 2 ,…,Y L-1 ),(h 1 ,h 2 ,…,h N ))步骤7:将编码器所获取的隐状态转移矩阵(h 1 ,h 2 ,…,h N )输入到CTC结构中,利用CTC的前后向算法强制语音和标签序列之间的单调对齐,其中CTC采用贪心搜索greedy_search的方法:pre_label C (Y 1 ,Y 2 ,…,Y L )=CTC_greedy_search((Y 1 ,Y 2 ,…,Y L-1 ),(h 1 ,h 2 ,…,h N ))L MTL =λL CTC +(1-λ)L attention其中λ为超参数,L CTC 表示CTC损失函数,L attention 表示注意力损失函数,L MTL 表示两者相加的多任务损失函数。
2.根据权利要求1所述的一种基于多路卷积网络的端到端语音识别方法,其特征在于,所述a=16000。
3.根据权利要求1所述的一种基于多路卷积网络的端到端语音识别方法,其特征在于,所述步骤2中将不定长的音频切分成固定长度的小段,每个小段的长度为10-30ms。