有效
一种铁路调度语音的标注方法及系统
薛启平、何振华、刘振彬、张景利、李静涛、金鑫、杨博、李喜坤、谢超杰、储相瑞、冯立恒、胡恒博、赵地
中国铁路北京局集团有限公司
薛
薛启平
机构 暂无技术领域 暂无
何
何振华 专利 11
郑州信大先进技术研究院语音音频处理乐器与声学物理仪器
刘
刘振彬
机构 暂无技术领域 暂无
张
张景利 专利 148
中国铁路北京局集团有限公司道路铁路桥梁工程固定建筑防灾防眩
李
李静涛 专利 9
郑州信大先进技术研究院语音音频处理乐器与声学语音识别
金
金鑫
机构 暂无技术领域 暂无
杨
杨博
机构 暂无技术领域 暂无
李
李喜坤 专利 9
郑州信大先进技术研究院语音音频处理乐器与声学物理仪器
谢
谢超杰 专利 8
郑州信大先进技术研究院物理仪器自然语言处理电子数据处理
储
储相瑞 专利 5
郑州信大先进技术研究院物理仪器电子数据处理语音识别
冯
冯立恒
机构 暂无技术领域 暂无
胡
胡恒博 专利 9
郑州信大先进技术研究院语音音频处理乐器与声学物理仪器
赵
赵地
机构 暂无技术领域 暂无
摘要
本发明提供一种铁路调度语音的标注方法及系统,先获取待标注铁路调度语音文件,基于人工智能语音标注算法对待标注铁路调度语音文件进行预标注处理,得到预标注文件;将待标注铁路调度语音文件以语音波形形式显示在界面图像中;将预标注文件中的若干条预标注数据按照预设排序规则排列显示在界面图像中;基于语音起止时间在语音波形的相应时间段上添加半透明遮罩;基于半透明遮罩和预设校正策略对预标注文件进行校正,得到标注文件;将标注文件与待标注铁路调度语音文件作为标注结果进行输出。
1.一种铁路调度语音的标注方法,其特征在于,包括以下步骤:获取待标注铁路调度语音文件,基于人工智能语音标注算法对待标注铁路调度语音文件进行预标注处理,得到预标注文件,所述预标注文件包括若干条预标注数据以及每条预标注数据关联的语音起止时间;将待标注铁路调度语音文件以语音波形形式显示在界面图像中;将预标注文件中的若干条预标注数据按照预设排序规则排列显示在界面图像中;基于语音起止时间在语音波形的相应时间段上添加半透明遮罩,每个半透明遮罩对应关联一个所述语音起止时间;以及为每个半透明遮罩和每条预标注数据关联预设鼠标事件;基于半透明遮罩和预设校正策略对预标注文件进行校正,得到标注文件:当检测到所述半透明遮罩对应的波形起止时间发生变化时,则获取变化后半透明遮罩对应的波形起止时间,用所述波形起止时间更新校正所述半透明遮罩关联的语音起止时间;以及当检测到所述半透明遮罩存在预设鼠标事件时,则基于所述半透明遮罩关联的语音起止时间在待标注铁路调度语音文件中查找对应的语音片段进行播放,并在接收到人工输入数据后,用所述人工输入数据更新所述半透明遮罩关联的预标注数据;或当检测所述预标注数据存在预设鼠标事件时,则基于所述预标注数据关联的语音起止时间在待标注铁路调度语音文件中查找对应的语音片段进行播放,并在接收到人工输入数据后,用所述人工输入数据更新所述预标注数据;将标注文件与待标注铁路调度语音文件作为标注结果进行输出。
2.根据权利要求1所述的铁路调度语音的标注方法,其特征在于:所述半透明遮罩对应的波形起止时间发生变化的条件为存在半透明遮罩整体拖动操作、存在半透明遮罩左边界线拖动操作和/或存在半透明遮罩右边界线拖动操作。
3.根据权利要求2所述的铁路调度语音的标注方法,其特征在于:基于半透明遮罩和预设校正策略对预标注文件进行人工校正过程中,还可以检测语音波形上是否存在半透明遮罩增加操作,若存在,则获取新增的半透明遮罩对应的波形起止时间作为新增的语音起止时间,将所述新增的语音起止时间添加到预标注文件中,并将所述新增的语音起止时间与所述新增半透明遮罩进行关联绑定,以及将新增的语音起止时间按照预设排序规则排列显示在界面图像中,并为所述新增的半透明遮罩关联预设鼠标事件;进一步检测所述新增的半透明遮罩是否存在预设鼠标事件,若存在,则基于所述新增的半透明遮罩关联的语音起止时间在待标注铁路调度语音文件中查找对应的语音片段进行播放,并在接收到人工输入数据后,将人工输入数据作为新增预标注数据与所述新增的语音起止时间进行关联绑定,并添加到预标注文件中,以及将新增的预标注数据显示在界面图像中,并为所述新增的预标注数据关联预设鼠标事件。
4.根据权利要求3所述的铁路调度语音的标注方法,其特征在于:当存在半透明遮罩增加操作、半透明遮罩整体拖动操作、半透明遮罩左边界线拖动操作或半透明遮罩右边界线拖动操作时,还需基于半透明遮罩不可重叠策略判断当前操作是否有效。
5.根据权利要求4所述的铁路调度语音的标注方法,其特征在于:所述半透明遮罩不可重叠策略为:当执行半透明遮罩增加操作或执行半透明遮罩整体拖动操作后,判断所述半透明遮罩左边界线的时间是否大于等于前一个半透明遮罩右边界线的时间,若是,则进一步判断所述半透明遮罩右边界线的时间是否小于等于后一个半透明遮罩左边界线的时间,若是,则判定当前操作有效;否则判定当前操作无效;当执行半透明遮罩左边界线拖动操作后,判断所述半透明遮罩左边界线的时间是否大于等于前一个半透明遮罩右边界线的时间,若是,则判定当前操作有效,否则判定当前操作无效;当执行半透明遮罩右边界线拖动操作后,判断所述半透明遮罩右边界线的时间是否小于等于后一个半透明遮罩左边界线的时间,若是,则判定当前操作有效,否则判定当前操作无效。
6.根据权利要求1所述的铁路调度语音的标注方法,其特征在于,所述预标注文件的获取步骤如下:针对待标注铁路调度语音文件,采用深度学习声源分离模型进行人声信号和环境声信号的分离,得到人声信号片段和环境声信号片段;针对人声信号片段,利用人声分离聚类模型对人声信号片段进行逻辑切分,获得人声逻辑片段;利用语音识别模型对所述人声逻辑片段进行文字转写,获取文字标注信息;以及基于调度员身份对所述人声逻辑片段进行聚类,并为归属于同一调度员的多个人声逻辑片段标注相同虚拟调度员标识,再利用声纹识别模型,将虚拟调度员标识和人声声纹库中的调度员身份进行识别关联,获得调度员身份标注信息;针对环境声信号片段,利用环境声分离聚类模型对环境声信号片段进行逻辑切分,获得环境声逻辑片段;基于环境声类别进行环境声逻辑片段聚类,将归属同一种环境声的多个环境声逻辑片段标注上相同虚拟环境声标识;利用环境声类别识别模型,将虚拟环境声标识和环境声声纹库中的环境声身份进行识别关联,获得环境声标注信息;基于预设整合策略对所述人声逻辑片段的文字标注信息、调度员身份标注信息以及所述环境声逻辑片段的环境声类别标注信息进行整合,得到若干条预标注数据,最终输出包含预标注数据以及预标注数据的语音起止时间的预标注文件。
7.根据权利要求6所述的铁路调度语音的标注方法,其特征在于,所述预设整合策略,执行:遍历人声逻辑片段,针对每一人声逻辑片段, 判断是否存在语音起始时间大于等于所述人声逻辑片段的语音起始时间的环境声逻辑片段;若存在,则进一步判定所述环境声逻辑片段的语音终止时间是否大于等于所述人声逻辑片段的语音终止时间,若大于等于,则判定所述人声逻辑片段位于所述环境声逻辑片段内,依据所述人声逻辑片段的语音起止时间对所述环境声逻辑片段进行二次逻辑切分;否则判定所述人声逻辑片段与所述环境声逻辑片段存在部分交叠,依据所述人声逻辑片段的语音起始时间对所述环境声逻辑片段进行二次逻辑切分;若不存在,则进一步是否存在语音终止时间小于等于所述人声逻辑片段的语音终止时间的环境声逻辑片段,若存在,则判定所述环境声逻辑片段位于所述人声逻辑片段内,不进行操作;否则判定所述人声逻辑片段与所述环境声逻辑片段存在部分交叠,依据所述人声逻辑片段的语音终止时间对所述环境声逻辑片段进行二次逻辑切分;遍历每一个语音起止时间,判断是否同时存在人声逻辑片段和环境声逻辑片段,若存在,则将当前语音起止时间对应的调度员身份标注信息、文字标注信息以及环境声类别标注信息进行整合,形成当前语音起止时间的预标注数据;若不存在,则将当前语音起止时间对应的调度员身份标注信息和文字标注信息、或环境声类别标注信息,作为当前语音起止时间的预标注数据;按照语音起止时间的先后顺序将每个语音起止时间的预标注数据进行排列。
8.一种铁路调度语音的标注系统,其特征在于,包括:标注任务获取模块,用于获取标注任务,所述标注任务包括待标注铁路调度语音文件;算法辅助预标注模块,用于基于人工智能语音标注算法对待标注铁路调度语音文件进行预标注处理,得到预标注文件,所述预标注文件包括若干条预标注数据以及每条预标注数据关联的语音起止时间;标注任务显示模块,用于将待标注铁路调度语音文件以语音波形形式显示在界面图像中;将预标注文件中的若干条预标注数据按照预设排序规则排列显示在界面图像中;基于语音起止时间在语音波形的相应时间段上添加半透明遮罩,每个半透明遮罩对应关联一个所述语音起止时间;以及为每个半透明遮罩和每条预标注数据关联预设鼠标事件;可视化校正模块,用于基于半透明遮罩和预设校正策略对预标注文件进行校正,得到标注文件:当检测到所述半透明遮罩对应的波形起止时间发生变化时,则获取变化后半透明遮罩对应的波形起止时间,用所述波形起止时间更新校正所述半透明遮罩关联的语音起止时间;以及当检测到所述半透明遮罩存在预设鼠标事件时,则基于所述半透明遮罩关联的语音起止时间在待标注铁路调度语音文件中查找对应的语音片段进行播放,并在接收到人工输入数据后,用所述人工输入数据更新所述半透明遮罩关联的预标注数据;或当检测所述预标注数据存在预设鼠标事件时,则基于所述预标注数据关联的语音起止时间在待标注铁路调度语音文件中查找对应的语音片段进行播放,并在接收到人工输入数据后,用所述人工输入数据更新所述预标注数据;标注任务结果输出模块,用于将标注文件与待标注铁路调度语音文件作为标注结果进行输出。
9.根据权利要求8所述的铁路调度语音的标注系统,其特征在于:还包括语音信号预处理模块、审核模块、抽检模块、任务管理模块以及角色管理模块;所述角色管理模块,用于设置不同角色,并为不同角色分配不同的处理权限;所述角色包括任务管理员、标注人员、审核人员以及抽检人员;所述语音信号预处理模块,用于对待标注铁路调度语音文件的语音信号进行语音检出处理、环境声抑制处理以及数据增强处理;所述任务管理模块,用于供任务管理员导入待标注铁路调度语音文件,以及导出有效语料;所述审核模块,用于供审核人员领取待审核任务进行可视化审核工作,并在审核通过后将所述待审核任务和审核结果变成待抽检任务进行发布,在审核失败时返回审核意见,并将待审核任务返回给标注人员重新标注,其中所述待审核任务为标注结果;所述抽检模块,用于供抽查人员领取待抽查任务,进行可视化审核工作,并在审核通过后将所述待抽查任务标注为抽检合格,该任务产生的标注结果标注为有效语料。
10.一种电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述程序时实现权利要求1-7任一项所述的铁路调度语音的标注方法的步骤。



