1.目标对象语音的获取方法,其特征在于,包括:获取混合语音数据,所述混合语音数据由多个对象的语音混合而成,多个所述对象中包含所述目标对象;基于卷积神经网络模型框架,对时域音频分离网络进行优化,得到优化后的时域音频分离网络;基于排列问题算法,利用所述优化后的时域音频分离网络对所述混合语音数据进行处理,得到只包含所述目标对象语音的语音数据;其中,基于卷积神经网络模型框架,对时域音频分离网络进行优化,得到优化后的时域音频分离网络,包括:基于卷积神经网络模型框架,对所述时域音频分离网络中的分离器进行优化,其中,将所述时域音频分离网络中的分离器替换为卷积自动分离器;将所述时域音频分离网络中的卷积自动分离器进行预设次数的空洞卷积处理;将所述时域音频分离网络中的卷积算法替换成深度循环可分离卷积算法;对所述时域音频分离网络中的分离器进行优化后进行最优参数确定,得到所述优化后的时域音频分离网络;其中,基于排列问题算法,利用所述优化后的时域音频分离网络对所述混合语音数据进行处理,得到只包含所述目标对象语音的语音数据,包括:利用所述优化后的时域音频分离网络对所述混合语音数据进行处理,其中,将所述混合语音数据转化成具有预设特征维度的向量;将所述具有预设特征维度的向量经过连续N层的空洞卷积,并重复M次,得到第一处理结果,所述N和M均为正整数;将所述第一处理结果作用到所述优化后的时域音频分离网络中的编码器处理的特征图上,得到第二处理结果,所述第二处理结果中包括代表第一语音的第一分离特征图和代表第二语音的第二分离特征图;基于所述混合语音数据中每条语音与麦克风的距离,对所述混合语音数据中的每条语音进行排序,得到排序后的语音数据;基于所述排序后的语音数据、所述第一分离特征图和所述第二分离特征图得到所述目标对象的语音数据;其中,基于所述排序后的语音数据、所述第一分离特征图和所述第二分离特征图得到所述目标对象的语音数据,包括:根据所述第一分离特征图和所述第二分离特征图对所述优化后的时域音频分离网络中的分离器进行加权处理,再对其进行调参优化处理,得到第二次优化后的时域音频分离网络;利用所述第二次优化后的时域音频分离网络对所述排序后的语音数据进行抽取,得到距离所述麦克风最近的所述目标对象的语音数据。
2.目标对象语音的获取装置,其特征在于,包括:获取模块,用于获取混合语音数据,所述混合语音数据由多个对象的语音混合而成,多个所述对象中包含所述目标对象;优化模块,用于基于卷积神经网络模型框架,对时域音频分离网络进行优化,得到优化后的时域音频分离网络;分离模块,用于基于排列问题算法,利用所述优化后的时域音频分离网络对所述混合语音数据进行处理,得到只包含所述目标对象语音的语音数据;其中,优化模块,包括:分离单元,用于基于卷积神经网络模型框架,对所述时域音频分离网络中的分离器进行优化,其中,将所述时域音频分离网络中的分离器替换为卷积自动分离器;将所述时域音频分离网络中的卷积自动分离器进行预设次数的空洞卷积处理;将所述时域音频分离网络中的卷积算法替换成深度循环可分离卷积算法;调参单元,用于对所述时域音频分离网络中的分离器进行优化后进行最优参数确定,得到所述优化后的时域音频分离网络;其中,分离模块,包括:转化单元,用于利用所述优化后的时域音频分离网络对所述混合语音数据进行处理,其中,将所述混合语音数据转化成具有预设特征维度的向量;第一计算单元,用于将所述具有预设特征维度的向量经过连续N层的空洞卷积,并重复M次,得到第一处理结果,所述N和M均为正整数;第二计算单元,用于将所述第一处理结果作用到所述优化后的时域音频分离网络中的编码器处理的特征图上,得到第二处理结果,所述第二处理结果中包括代表第一语音的第一分离特征图和代表第二语音的第二分离特征图;排序单元,用于基于所述混合语音数据中每条语音与麦克风的距离,对所述混合语音数据中的每条语音进行排序,得到排序后的语音数据;第三计算单元,用于基于所述排序后的语音数据、所述第一分离特征图和所述第二分离特征图得到所述目标对象的语音数据;其中,第三计算单元,包括:处理子单元,用于根据所述第一分离特征图和所述第二分离特征图对所述优化后的时域音频分离网络中的分离器进行加权处理,再对其进行调参优化处理,得到第二次优化后的时域音频分离网络;抽取子单元,用于利用所述第二次优化后的时域音频分离网络对所述排序后的语音数据进行抽取,得到距离所述麦克风最近的所述目标对象的语音数据。
3.目标对象语音的获取设备,其特征在于,包括:存储器,用于存储计算机程序;处理器,用于执行所述计算机程序时实现如权利要求1所述目标对象语音的获取方法的步骤。
4.一种可读存储介质,其特征在于:所述可读存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现如权利要求1所述目标对象语音的获取方法的步骤。