1.一种面向国产操作系统的离线实时语音转录优化方法,其特征在于,所述方法包括:获取原始音频信号进行分割和识别操作,得到初步转录文本,所述原始音频信号包括自定义长音频信号和自定义短音频信号;对所述初步转录文本进行实时字词纠错,得到纠错后转录文本;对所述纠错后转录文本进行后处理,得到离线实时语音转录结果,所述后处理包括潜在的停顿以及句子边界判断和语音转录进程停止判断;响应于监测到所述原始音频信号为所述自定义短音频信号,通过预设音频采样率和预设缓冲区对所述自定义短音频信号进行分割和识别操作。
2.根据权利要求1所述的方法,其特征在于,所述获取原始音频信号进行分割和识别操作,得到初步转录文本,包括:接收采集端采集的原始音频信号;对所述原始音频信号进行预处理得到强化后音频信号;根据语音活动检测结果将所述强化后音频信号进行分割后拼接,得到待识别音频信号;对所述待识别音频信号进行语音识别并转换成所述初步转录文本。
3.根据权利要求2所述的方法,其特征在于,所述根据语音活动检测结果将所述强化后音频信号进行分割后拼接,得到待识别音频信号,包括:根据语音活动检测结果将所述强化后音频信号分割成若干个片段语音,其中,分割以自然停顿或自定义时间长度为依据;对相邻的片段语音进行拼接,得到所述待识别音频信号,其中,所述相邻的片段语音在拼接处存在自定义长度的重合部分。
4.根据权利要求3所述的方法,其特征在于,所述对所述待识别音频信号进行语音识别并转换成所述初步转录文本,包括:以滑动窗口模式对所述待识别音频信号中的重合部分进行识别;去除所述重合部分,得到所述初步转录文本。
5.根据权利要求1所述的方法,其特征在于,所述对所述初步转录文本进行实时字词纠错,得到纠错后转录文本,包括:使用分词技术对所述初步转录文本进行逐词的语法和拼写检查;利用上下文信息识别出不符合语法或语义的词并标记为不确定词语;计算所述不确定词语的编辑距离并结合上下文信息生成一组候选的校正词语;对所述候选的校正词语进行排序,将最优匹配项的校正词语选出并替换至所述初步转录文本中,得到所述纠错后转录文本。
6.根据权利要求1所述的方法,其特征在于,所述对所述纠错后转录文本进行后处理,得到离线实时语音转录结果,包括:分析所述纠错后转录文本中的语法结构、主题和上下文语义,识别出潜在的停顿以及句子边界;实时分析所述原始音频信号在语音输入时的响应水平,识别出原始音频信号对应语音流中的显著停顿或强调变化以及节奏和音调变化;根据识别出的显著停顿或强调变化以及节奏和音调变化辅助判断所述潜在的停顿以及句子边界;在自然语言技术下根据所述潜在的停顿以及句子边界对所述纠错后转录文本进行标点建议生成;根据用户指定的停顿长短阈值,实时监测所述原始音频信号中的静默时长;响应于所述原始音频信号中的静默时长超过用户自定义的静默时长,触发语音转录进程的自动停止功能。
7.根据权利要求3所述的方法,其特征在于,所述获取原始音频信号进行分割和识别操作,得到初步转录文本之后,所述方法还包括:计算各个片段语音的置信度评分C(x)对各个片段语音进行重复识别调整,其中,所述置信度评分C(x)的计算公式为 x代表识别的片段语音,P i (x)表示第i个模型对x的置信概率,N是总的评估方法数量;响应于检测到置信度评分C(x)低于目标阈值θ的片段语音,执行自动调整处理策略。
8.根据权利要求7所述的方法,其特征在于,所述响应于检测到置信度评分C(x)低于目标阈值θ的片段语音,执行自动调整处理策略,包括:针对置信度评分C(x)低于目标阈值θ的片段语音,增加重复识别时的音频长度L repeat ,其中,L repeat =L base +α×(L complex -L base ),L base 是基础处理长度,L complex 是复杂度判断后的理想处理长度,α是取值范围在0到1之间的调节系数。
9.一种面向国产操作系统的离线实时语音转录优化装置,其特征在于,所述装置包括:信号操作模块,用于获取原始音频信号进行分割和识别操作,得到初步转录文本,所述原始音频信号包括自定义长音频信号和自定义短音频信号;字词纠错模块,用于对所述初步转录文本进行实时字词纠错,得到纠错后转录文本;后处理模块,用于对所述纠错后转录文本进行后处理,得到离线实时语音转录结果,所述后处理包括潜在的停顿以及句子边界判断和语音转录进程停止判断;短音频处理模块,用于响应于监测到所述原始音频信号为所述自定义短音频信号,通过预设音频采样率和预设缓冲区对所述自定义短音频信号进行分割和识别操作。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有计算机程序,所述计算机程序由处理器加载并执行以实现如上述权利要求1至8任一项所述的面向国产操作系统的离线实时语音转录优化方法。