有效

一种基于多路卷积网络的端到端语音识别方法

邱原、肖浩、魏锦波、刘作、黎聪、寇佳威、赵中麒、贺胡松
西安理工大学

摘要

本发明公开了一种基于多路卷积网络的端到端语音识别方法,专门针对中文语音识别过程中对于汉语发音中发音单元粗粒度化的识别改进,采用多路卷积网络MCNN对于语音数据从发音的时间帧和发音的频率谱的方向进行特征提取;在transformer的输入前端增加一个MCNN的多路卷积网络以此提前获取语音的局部特征,输入transformer网络中进行语音识别的训练,并在Encoder层后还增加了一个CTC结构,最后利用联合训练模型以CTC为辅助训练,从而加快整体模型的收敛速度。通过大量实验证明了本发明具有更强的鲁棒性和超过一般语音识别模型的识别率,并且因为模型可以模块化组成,为后期的改进提供了更强的可行性。