1.基于特征差异集成的非自回归语音识别方法,其特征在于,具体按照以下步骤实施:步骤1,收集音频数据转换为wav格式文件类型并进行标注,得到数据集,将数据集划分为训练集、验证集和测试集;步骤2,预处理数据集中的音频文件;步骤3,统计训练数据集中的文本数据;步骤4,构建语音识别模型FDI;步骤5,使用训练集对步骤4构建的FDI模型进行训练,得到语音识别模型,使用验证集评估模型训练过程中的性能变化;步骤6,将测试集输入到训练好的语音识别模型FDI中,测试语音识别模型的性能。
2.根据权利要求1所述的基于特征差异集成的非自回归语音识别方法,其特征在于,在所述步骤1中,收集各种音频格式的音频数据,将其统一转换为wav格式音频文件。
3.根据权利要求2所述的基于特征差异集成的非自回归语音识别方法,其特征在于,在所述步骤1中,标注是指将音频数据中的内容提取出来文本表示作为真实标签与音频数据对应。
4.根据权利要求3所述的基于特征差异集成的非自回归语音识别方法,其特征在于,所述步骤2中,预处理具体为:计算每个音频文件的采样率和音频长度信息,对于不符合采样要求或者音频长度过长和过短的音频数据进行丢弃。
5.根据权利要求4所述的基于特征差异集成的非自回归语音识别方法,其特征在于,在所述步骤3中,统计训练数据集中的文本数据具体为:步骤3.1,将训练集中的文本数据,以字作为基本单元进行划分,统计出现频率并进行排序、去重后,形成初始的token列表;步骤3.2,向初始token列表中添加开始标记、结束标记、未知标记和空白标记形成最终的token列表。
6.根据权利要求5所述的基于特征差异集成的非自回归语音识别方法,其特征在于,在所述步骤4中,构建的语音识别模型FDI包括依次连接的编码器层、FDI层、解码器层和损失层。
7.根据权利要求6所述的基于特征差异集成的非自回归语音识别方法,其特征在于,在所述步骤5中,将步骤2中预处理后的音频数据和对应的标签数据输入到语音识别模型FDI中进行训练,具体训练过程如下:步骤5.1,首先对音频数据提取80维的FBank频谱特征,并对频谱特征在时间和频率上进行增强;步骤5.2,将步骤5.1中增强后得到的音频数据输入到编码器层中,编码器层是基于注意力机制的Conformer,首先进行4倍下采样,然后进入多个Conformer块,每个Conformer块包含了两个半步前馈层、一个多头注意力和一个卷积层,数据在Conformer块中的流程如下:x″ i =x′ i +CNN(x′ i )其中:x i 为下采样后的声学特征,FFN为前馈层,MHSA为多头注意力机制,CNN为卷积层,Layernorm为层归一化;步骤5.3,将经过编码器的编码结果输入到FDI层中进行对齐,特征在FDI中首先会对比前后相邻的特征之间的差异,将特征的差异并转化为一个具体数值,经过ReLu激活函数得到当前特征的变化量,变化量为0-1之间,根据变化量变化趋势判定当前语音前后边界并进行加权聚合,聚合的特征可以视为一个字符,之后继续聚合下一个字符;计算变化量时,空白语音、环境噪声和停顿会因为特征类似导致变化量较少,从而减少对语音识别准确率的影响;步骤5.4,将步骤5.3的聚合结果输入到解码器层进行特征的最后编码,解码器层使用了Transformer的编码器层,对经过FDI层聚合后的特征建立上下文关联;首先会对特征进行位置编码,之后会进入到多个编码器块中进行特征编码,每个编码器块包含了两个层归一化,一个多头注意力和一个前馈层,具体流程如下:x′=x+Posx″=Layernorm(x′+MHSA(x′))x″′=Layernorm(x″+FFN(x″))其中x为经过FDI层聚合后的特征,Pos表示位置编码;步骤5.5,将步骤5.4的结果输入到损失层计算损失函数,损失层由一个线性层和CTC损失函数构成,首先会将每个特征映射成token列表长度一致特征维度,通过CTC损失函数计算预测结果和真实标签的损失,使用Adam优化器进行优化,优化器的学习率为0.001,在迭代结束后,得到的最终模型即为已经训练好的语音识别模型FDI。
8.根据权利要求7所述的基于特征差异集成的非自回归语音识别方法,其特征在于,在所述步骤6中,将步骤2中预处理好的测试集数据输入到步骤5中训练好的FDI模型中进行测试,通过词错率指标评估模型的性能。