在审

一种基于联合交叉注意力机制和迭代建模的视听语音分离系统及方法

胡英、陈芳旭、杨文忠、林栎、谷博文
新疆大学

摘要

本发明涉及一种基于联合交叉注意力机制和迭代建模的视听语音分离系统及方法,系统包括:视听编码模块,用于采集视听数据,利用视听数据,获取音频特征和视觉特征;特征精细化模块,用于对音频特征和视觉特征分别进行优化,获取音频嵌入和视觉嵌入;多模态信息融合模块,用于将音频嵌入和视觉嵌入进行特征融合,生成模态融合特征;分离模块,用于将模态融合特征和音频特征进行迭代优化,在迭代优化过程中,将上一次迭代优化结果依次进行多尺度特征提取和下采样操作,从而对多尺度特征和下采样特征进行加和运算,并进一步提取帧内和帧间的信息以及自适应特征调制,生成目标特征掩码;音频编码模块,用于利用目标特征掩码,重建出估计语音波形。

暂无引用专利