1.一种基于实体替换的语音数据增强方法,其特征在于,包括如下步骤:步骤1:构建语音识别模型,获取语音样本并进行标注,得到带标注的语音;根据语音样本和标注构建关注实体集合;步骤2:根据语音识别模型和关注实体集合,构建实体定位模型,用于寻找带标注语音中每个实体的起止时刻,输出全部起止时候集合;步骤3:采用关注实体集合中同类实体替换文本中的实体,并根据起止时刻替换对应语音数据,形成新的带标注语音集合;步骤4:将新的带标注语音集合与原先的带标注语音集合合并,形成新的语音识别训练样本集合;其中,步骤2中所述的实体定位模型,包含如下步骤:步骤2-1:从关注实体集合E中选择第k个实体e k ;k的初始值为1;步骤2-2:从训练集X选择第i条语音x i 输入步骤1中构建的语音识别模型,其中i的初始值设为1,判断输出的第i条语音对应的文本 中该实体e k 是否出现,如果没有出现,则进行步骤2-3,否则进行步骤2-4;步骤2-3:设定实体e k 在文本 中样本起止时刻集合sample_duration k,i 为空集合,如果训练集X还有语音没有被检测,则重复执行步骤2-2,如果训练集X中每条语音都被检测,则将训练集中X所有与实体e k 关联的起止时刻集合组成实体起止时刻集合entity_duration k ,表示如下:entity_duration k={sample_duration k,1 ,sample_duration k,2 ,....,sample_duration k,N }并判断关注实体集合E中所有T个实体是否均己检查过,如果没有则将k的值增加1,并重新执行步骤2-1,如果是则将所有实体起止时刻集合组成全部起止时候集合total_duration,表示如下:total_duration={entity_duration 1 ,entity_duration 2 ,....,entity_duration T }步骤2-4:设定实体e k 在第i条语音对应的文本 中第j次出现位置的第一个字对应的语音帧时刻减去预设时长为实体的开始时刻 第j次出现位置的最后一个字对应的语音帧时刻加上预设时长为实体的结束时刻 步骤2-5:将实体e k 在文本 中所有实体的开始时刻和对应的结束时刻组成起止时刻,并将所有的起止时刻组成样本起止时刻集合sample_duration k,i ,表示如下:其中,P表示起止时刻的数量;步骤2-6:将i的值增加1,返回执行步骤2-2。
2.根据权利要求1所述的一种基于实体替换的语音数据增强方法,其特征在于,步骤1中所述的构建语音识别模型和关注实体集合,包含如下步骤:步骤1-1:设计语音识别神经网络;步骤1-2:采集语音样本集合,表示为训练集X如下:X={x 1 ,x 2 ,....,x N }其中,N为训练集中的样本总数,x 1 ,x 2 ,...,x N 分别为训练集中的第1,2,...,N个语音样本即训练样本;步骤1-3:对步骤1-2的语音样本集合进行人工标注,得到标注文本集合,表示为标注集Y如下:Y={y 1 ,y 2 ,...,y N }其中,y 1 ,y 2 ,...,y N 分别语音样本x 1 ,x 2 ,...,x N 对应的语音文字标注;步骤1-4:使用训练集X和标注集Y,训练步骤1-1中设计的语音识别神经网络,将训练数据作为输入序列,将语音识别神经网络的输出与标注集中的语音文字标注进行对比,并根据连接时序分类损失函数优化所述语音识别神经网络的参数,获得语音识别模型;步骤1-5:使用分词工具对标注集Y中所有的语音文字标注进行分词,对分词结果进行筛选,保留当前需要关注的词,作为关注实体,并对其进行分类,一共分为M类关注实体,形成关注实体集合E。
3.根据权利要求2所述的一种基于实体替换的语音数据增强方法,其特征在于,步骤1-1中所述的语音识别神经网络,结构如下:所述的语音识别神经网络由语音特征编码层和识别结果输出层组成,其中语音特征编码层包含3层卷积神经网络和12层Transformer神经网络,识别结果输出层包含1层全连接神经网络,所述语音识别神经网络的输入为语音,输出为该语音对应的文本;按照预设输出比例将输入的语音流转化成文本流。
4.根据权利要求3所述的一种基于实体替换的语音数据增强方法,其特征在于,步骤1-1中所述的预设输出比例,即按照每50ms音频输出一个文字的比例将音频流转化成文字流。
5.根据权利要求4所述的一种基于实体替换的语音数据增强方法,其特征在于,步骤2-4中所述的预设时长为20ms。
6.根据权利要求5所述的一种基于实体替换的语音数据增强方法,其特征在于,步骤1-5中所述的筛选和分类,为人工筛选和人工分类。