有效
一种水声信号降噪方法、系统、设备及存储介质
周翱隆、李小勇、宋君强、徐国军、任开军、邓科峰、冷洪泽、任小丽
中国人民解放军国防科技大学
周
周翱隆 专利 11
中国人民解放军国防科技大学物理仪器计算技术乐器与声学
李
李小勇 专利 70
中国人民解放军国防科技大学生物模型计算计算模型系统电子数据处理

宋君强 专利 137
中国人民解放军国防科技大学乘客用品布置一般车辆分离混合
徐
徐国军 专利 25
中国人民解放军国防科技大学无线电定位导航测量与测试物理仪器
任
任开军 专利 80
中国人民解放军国防科技大学生物模型计算计算模型系统电子数据处理
邓
邓科峰 专利 53
中国人民解放军国防科技大学计算技术物理仪器数据存储检索
冷
冷洪泽 专利 24
中国人民解放军国防科技大学生物模型计算计算技术物理仪器
任
任小丽 专利 46
中国人民解放军国防科技大学电子数据处理计算技术物理仪器
摘要
本发明公开了一种水声信号降噪方法、系统、设备及存储介质,包括获取带噪音频,从带噪音频中提取出带噪音频复数频谱,通过编码器对带噪音频复数频谱进行降采样,再通过第一自注意力模块学习复数频谱在时间维度上的第一特征,并通过第二自注意力模块学习复数频谱在频率维度上的第二特征,融合第一特征和第二特征,通过解码器对融合特征进行上采样,得到降噪音频复数频谱,将降噪音频复数频谱转换为降噪音频,通过分别从特征的时间维度和频率维度捕获特征的长期依赖和局部依赖关系,两条分支通过信息交互互补信息,增强了模块的表达能力,提高了学习带噪音频复数频谱的时频谱特征的准确性,有效的抑制了噪声信号的干扰,提高了降噪性能。
1.一种水声信号降噪方法,其特征在于,所述水声信号降噪方法包括:获取带噪音频;从所述带噪音频中提取出带噪音频复数频谱;通过编码器对所述带噪音频复数频谱进行降采样,得到所述带噪音频的高维特征;通过第一自注意力模块学习所述复数频谱在时间维度上的第一特征,并通过第二自注意力模块学习所述复数频谱在频率维度上的第二特征,所述自注意力模块包括多个自注意力块,具体为:将所述带噪音频的高维特征并行输入第1个第一自注意力块和第1个第二自注意力块,得到第1个第一特征和第1个第二特征;将所述第1个第一特征和所述第1个第二特征进行信息交互,得到交互的第1个第一特征和交互的第1个第二特征,其中,所述将所述第1个第一特征和所述第1个第二特征进行信息交互的计算公式为:其中,Conv为卷积核大小为(1,1),步长为(1,1)的二维卷积层, 为第1个第一特征, 为交互的第1个第一特征, 为第1个第二特征, 为交互的第1个第二特征;将所述交互的第1个第一特征和所述交互的第1个第二特征并行输入第2个第一自注意力块和第2个第二自注意力块,得到第2个第一特征和第2个第二特征,将所述第2个第一特征和所述第2个第二特征进行信息交互,得到交互的第2个第一特征和交互的第2个第二特征,依次类推,直至得到最后一个第一自注意力块和最后一个第二自注意力块输出的第n个第一特征和第n个第二特征,将所述第n个第一特征和所述第n个第二特征进行信息交互,得到所述第一特征和所述第二特征,其中,所述n为自注意力块的数量;融合所述第一特征和所述第二特征,得到融合特征;通过解码器对所述融合特征进行上采样,得到降噪音频复数频谱;将所述降噪音频复数频谱转换为降噪音频。
2.根据权利要求1所述的水声信号降噪方法,其特征在于,所述编码器包括3个叠加的卷积块,其中,每个卷积块包括一个2D卷积层、批归一化层和参数整流线性单元激活函数;所述通过编码器对所述带噪音频复数频谱进行降采样的计算公式为:Y∈R T×F×2U Encoder ∈R T′×F′×C其中,Y为带噪音频复数频谱, 为第i个卷积块的输出,PReLU为参数整流线性单元激活函数,BN为批归一化层,U Encoder 为带噪音频的高维特征,T为时间帧数,F为频率点数,C为通道数,所述2D卷积层的卷积核均为(6,4),步长均为(2,2),所述通道数为16、32和64。
3.根据权利要求2所述的水声信号降噪方法,其特征在于,每个所述第一自注意力块包括一个第一全局自注意力块和一个第一局部自注意力块,所述将所述带噪音频的高维特征输入第1个第一自注意力块,得到第1个第一特征,包括:将所述带噪音频的高维特征并行输入所述第1个第一自注意力块的第一全局自注意力块和第一局部自注意力块,得到第1个时间维度的全局自注意力输出特征和第1个时间维度的局部自注意力输出特征;其中,将所述带噪音频的高维特征输入所述第1个第一自注意力块的第一全局自注意力块,得到第1个时间维度的全局自注意力输出特征的计算公式为:Q,K,V=Reshape local (Linear(U Encoder )){Q,K,V}∈R T′×(F′×C)其中,Q为自注意力机制的核心组件Query,K为自注意力机制的核心组件Key,V为自注意力机制的核心组件Value,Q,K和V之间的所有操作为矩阵乘法,Reshape local (·)为将张量的形状从R T′×F′×C 变换为R T′×(F′×C) ,Linear为全连接层,W T 为时间维度的注意力矩阵,Softmax为激活函数,Reshape global* (·)为反向操作, 为第1个时间维度的全局自注意力输出特征;其中,将所述带噪音频的高维特征输入所述第1个第一自注意力块的第一局部自注意力块,得到第1个时间维度的局部自注意力输出特征的计算公式为:T local =2N T +1S T =T′Conv(SA T )∈R T′×1×(F′×C)其中,N T 为当前时间帧在两侧选取的相邻时间帧数,T local 为每个局部分段的宽度,S T 为局部分段的数量, 为时间维度的局部自注意力机制的输入特征,SA T 为时间维度的自注意力机制的输出特征,Segmentation(·)为将特征向量分成局部分段并重新组合成得到的特征向量,LSA(·)为对局部分段自注意力运算,Reshape local (·)为将张量的形状从R T ′×1×(F′×C) 变换为R T′×F′×C , 为第1个时间维度的局部自注意力输出特征;将所述第1个时间维度的全局自注意力输出特征和第1个时间维度的局部自注意力输出特征进行链接与卷积操作,得到第1个第一特征;其中,所述将所述第1个时间维度的全局自注意力输出特征和第1个时间维度的局部自注意力机制进行链接与卷积操作的计算公式为:U Res ∈R T′×F′×C其中, 为第1个第一特征,Concat为链接操作,Conv为卷积核大小为(1,1),步长为(1,1)的二维卷积层。
4.根据权利要求3所述的水声信号降噪方法,其特征在于,每个所述第二自注意力块包括一个第二全局自注意力块和一个第二局部自注意力块;所述将所述带噪音频的高维特征输入第1个第二自注意力块,得到第1个第二特征,包括:将所述带噪音频的高维特征并行输入所述第1个第二自注意力块的第二全局自注意力块和第二局部自注意力块,得到第1个频率维度的全局自注意力输出特征和第1个频率维度的局部自注意力输出特征;其中,将所述带噪音频的高维特征输入所述第1个第二自注意力块的第二全局自注意力块,得到第1个频率维度的全局自注意力输出特征的计算公式为:Q,K,V=Reshape local (Linear(U Encoder )){Q,K,V}∈R F′×(T′×C)其中,Q为自注意力机制的核心组件Query,K为自注意力机制的核心组件Key,V为自注意力机制的核心组件Value,Q,K和V之间的所有操作为矩阵乘法,Reshape local (·)为将张量的形状从R T′×F′×C 变换为R F′×(T′×C) ,Linear为全连接层,W F 为频率维度的注意力矩阵,Softmax为激活函数,Reshape global* (·)为反向操作, 为第1个频率维度的全局自注意力输出特征;其中,将所述带噪音频的高维特征输入所述第1个第二自注意力块的第二局部自注意力块,得到第1个频率维度的局部自注意力输出特征的计算公式为:F local =2N F +1S F =F′Conv(SA F )∈R F′×1×(T′×C)其中,N F 为当前频点在两侧选取的相邻频点数,F local 为每个局部分段的宽度,S F 为局部分段的数量, 为频率维度的局部自注意力机制的输入特征,SA为自注意力机制的输出特征,Segmentation(·)为将特征向量分成局部分段并重新组合成得到的特征向量,LSA(·)为对局部分段自注意力运算,Reshape local (·)为将张量的形状从R F′×1×(T′×C) 变换为R F ′×T′×C , 为第1个频率维度的局部自注意力输出特征;将所述第1个频率维度的全局自注意力输出特征和第1个频率维度的局部自注意力输出特征进行链接与卷积操作,得到第1个第二特征;其中,所述将所述第1个频率维度的全局自注意力输出特征和第1个频率维度的局部自注意力机制进行链接与卷积操作的计算公式为:U Res ∈R F′×T′×C其中, 为第1个第二特征,Concat为链接操作,Conv为卷积核大小为(1,1),步长为(1,1)的二维卷积层。
5.根据权利要求4所述的水声信号降噪方法,其特征在于,所述将所述第一特征和所述第二特征进行特征融合,得到融合特征,包括:将所述第一特征和所述第二特征进行链接,得到链接结果;将所述链接结果输入卷积块,得到融合特征;其中,所述卷积块包括一个2D卷积层、批归一化层和参数整流线性单元激活函数,所述2D卷积层的卷积核大小为(1,1),步长为(1,1)。
6.根据权利要求5所述的水声信号降噪方法,其特征在于,所述解码器包含3个亚像素块,每个亚像素块包括一个2D卷积层、批归一化层和参数整流线性单元激活函数2D卷积的通道数分别设置为32,16和2;所述将所述融合特征利用解码器进行上采样计算,得到降噪音频复数频谱,包括:将所述融合特征输入亚像素层利用卷积操作将所述融合特征的通道数C扩张为C×r 2 ,得到第一融合特征;将所述第一融合特征利用像素洗牌进行像素点重排,得到所述降噪音频复数频谱。
7.一种水声信号降噪系统,其特征在于,所述水声信号降噪系统包括:数据获取模块用于获取带噪音频;数据提取模块用于从所述带噪音频中提取出带噪音频复数频谱;数据编码模块用于通过编码器对所述带噪音频复数频谱进行降采样,得到所述带噪音频的高维特征;特征学习模块用于通过第一自注意力模块学习所述复数频谱在时间维度上的第一特征,并通过第二自注意力模块学习所述复数频谱在频率维度上的第二特征,所述自注意力模块包括多个自注意力块,具体为:将所述带噪音频的高维特征并行输入第1个第一自注意力块和第1个第二自注意力块,得到第1个第一特征和第1个第二特征;将所述第1个第一特征和所述第1个第二特征进行信息交互,得到交互的第1个第一特征和交互的第1个第二特征,其中,所述将所述第1个第一特征和所述第1个第二特征进行信息交互的计算公式为:其中,Conv为卷积核大小为(1,1),步长为(1,1)的二维卷积层, 为第1个第一特征, 为交互的第1个第一特征, 为第1个第二特征, 为交互的第1个第二特征;将所述交互的第1个第一特征和所述交互的第1个第二特征并行输入第2个第一自注意力块和第2个第二自注意力块,得到第2个第一特征和第2个第二特征,将所述第2个第一特征和所述第2个第二特征进行信息交互,得到交互的第2个第一特征和交互的第2个第二特征,依次类推,直至得到最后一个第一自注意力块和最后一个第二自注意力块输出的第n个第一特征和第n个第二特征,将所述第n个第一特征和所述第n个第二特征进行信息交互,得到所述第一特征和所述第二特征,其中,所述n为自注意力块的数量;特征融合模块用于融合所述第一特征和所述第二特征,得到融合特征;数据解码模块用于通过解码器对所述融合特征进行上采样,得到降噪音频复数频谱;数据输出模块用于将所述降噪音频复数频谱转换为降噪音频。
8.一种水声信号降噪设备,其特征在于,包括至少一个控制处理器和用于与所述至少一个控制处理器通信连接的存储器;所述存储器存储有可被所述至少一个控制处理器执行的指令,所述指令被所述至少一个控制处理器执行,以使所述至少一个控制处理器能够执行如权利要求1至6任一项所述的一种水声信号降噪方法。
9.一种计算机可读存储介质,其特征在于:所述计算机可读存储介质存储有计算机可执行指令,所述计算机可执行指令用于使计算机执行如权利要求1至6任一项所述的一种水声信号降噪方法。
暂无引用专利



