1.一种基于多语种多模态情感识别方法,其特征在于,包括以下步骤:获取无标注的多语种非平行语音、文本数据,采用自监督学习方法分别进行语音、文本模型的训练,得到自监督预训练模型;获取带标注的多语种多模态情感语料;采用所述自监督预训练模型对所述多语种多模态情感语料进行特征提取,得到多模态初级特征序列;利用基于多模态重缩放注意力机制的模态协作融合网络对所述多模态初级特征序列进行多模态联合表征建模,并根据多模态联合表征进行情感识别,输出情感识别结果;其中,所述基于多模态重缩放注意力机制的模态协作融合网络包括依次连接的单模态编码模块、多模态重缩放注意力模块、池化拼接模块和多语种情感分类联合模块;所述单模态编码模块包括若干并联的单模态编码单元,每个单模态编码单元均包括依次连接的输入层、一维卷积层和正弦位置嵌入层;多模态重缩放注意力模块由以串联形式迭代的多个多模态重缩放注意力单元构成,每个多模态重缩放注意力单元包括线性层、引入正则约束和注意力外推因子的模态间重缩放协作层以及与所述模态间重缩放协作层的输出端均有连接且并联的多个单模态信息增强单元;所述多语种情感分类联合模块包括并行连接的情感分类器以及引入梯度反转层的语种对抗训练模块;所述情感分类器用于基于所述多模态联合表征,通过线性层输出情感识别结果;所述语种对抗训练模块用于引入梯度反转层对所述多模态联合表征进行语种对抗训练,完成跨语种深度语义对齐。
2.如权利要求1所述的一种多语种多模态情感识别方法,其特征在于,所述利用基于多模态重缩放注意力机制的模态协作融合网络对所述多模态初级特征序列进行多模态联合表征建模,并根据多模态联合表征进行情感识别,输出情感识别结果的步骤包括:利用所述单模态编码模块对所述多模态初级特征序列进行投影编码,得到各个模态的单模态编码特征向量;引入正则约束和注意力外推因子,利用所述多模态重缩放注意力模块对各个模态的所述单模态编码特征向量进行迭代重缩放拼接操作,得到对应的模态深度融合特征;将各个模态的所述模态深度融合特征进行池化并拼接,得到多模态联合表征;利用所述多语种情感分类联合模块对所述多模态联合表征进行情感识别,得到情感识别结果。
3.如权利要求2所述的一种多语种多模态情感识别方法,其特征在于,所述引入正则约束和注意力外推因子,利用所述多模态重缩放注意力模块对各个模态的所述单模态编码特征向量进行迭代重缩放拼接操作,得到对应模态的模态深度融合特征的步骤包括:利用所述线性层将各个模态的单模态编码特征向量分别进行线性变换,得到对应模态的单模态查询向量、单模态键向量和单模态值向量;基于引入的正则约束和注意力外推因子,通过所述模态间重缩放协作层将各个模态的单模态键向量分别进行重缩放处理,得到对应的重缩放单模态键向量,并将各个模态的所述重缩放单模态键向量在时间维度上进行拼接处理,得到超模态键向量;通过所述模态间重缩放协作层将各个模态的单模态值向量在时间维度上进行拼接处理,得到超模态值向量;将所述超模态键向量、所述超模态值向量输入所有所述单模态信息增强单元,同时将各个模态的单模态查询向量分别输入与其模态对应的所述单模态信息增强单元中,以使各个所述单模态信息增强单元根据所述超模态键向量、所述超模态值向量以及与其模态对应的单模态查询向量对每种模态进行信息增强,输出对应模态的多模态协作信息增强特征;将各个模态的所述多模态协作信息增强特征输入下一个所述多模态重缩放注意力单元,利用以串联形式迭代的多个多模态重缩放注意力单元对所述模态协作信息增强特征进行迭代计算,直至最后一个多模态重缩放注意力单元输出模态深度融合特征。
4.如权利要求3所述的一种多语种多模态情感识别方法,其特征在于,所述超模态键向量的计算公式为:其中,式中, 表示超模态键向量; 表示在时间维度上的拼接操作; 表示m模态的单模态键向量; 表示m模态的重缩放单模态键向量; 表示正则约束; 表示注意力外推因子; 表示m模态特征序列的时序长度; 表示m模态特征序列的时序长度上限值;m表示模态类型;所述超模态值向量的计算公式为:式中, 表示超模态值向量; 表示m模态的单模态值向量。
5.如权利要求4所述的一种多语种多模态情感识别方法,其特征在于,所述多模态协作信息增强特征的计算公式为:式中, 表示m模态的多模态协作信息增强特征; 表示层正则化; 表示前馈网络;m表示模态类型; 表示超模态键向量; 表示超模态值向量; 表示m模态的单模态查询向量;d表示超模态键向量的维度; 表示m模态的单模态编码特征向量。
6.如权利要求2所述的一种多语种多模态情感识别方法,其特征在于,所述基于多模态重缩放注意力机制的模态协作融合网络在训练过程中采用的联合损失函数为:其中,式中, 表示联合损失函数; 表示情感分类损失函数; 表示语种分类损失函数; 表示控制对抗训练损失权重的超参数; 表示情感分类器输出的情感分类结果; 表示情感标签; 表示语种对抗训练模块的输出结果; 表示语种标签。
7.如权利要求1所述的一种多语种多模态情感识别方法,其特征在于,所述多语种多模态情感语料包括不同语种的语音模态情感语料和文本模态情感语料;所述自监督预训练模型包括HuBERT预训练模型和RoBERTa预训练模型;所述采用所述自监督预训练模型对所述多语种多模态情感语料进行特征提取,得到多模态初级特征序列的步骤包括:利用HuBERT预训练模型对不同语种的语音模态情感语料进行特征提取,得到语音模态初级特征序列;利用RoBERTa预训练模型对不同语种的文本模态情感语料进行特征提取,得到文本模态初级特征序列。
8.一种多语种多模态情感识别系统,其特征在于,所述系统包括:自监督学习模块,用于获取无标注的多语种非平行语音、文本数据,采用自监督学习方法分别进行语音、文本模型的训练,得到自监督预训练模型;情感语料获取模块,用于获取带标注的多语种多模态情感语料;初级特征提取模块,用于采用所述自监督预训练模型对所述多语种多模态情感语料进行特征提取,得到多模态初级特征序列;情感识别模块,用于利用基于多模态重缩放注意力机制的模态协作融合网络对所述多模态初级特征序列进行多模态联合表征建模,并根据多模态联合表征进行情感识别,输出情感识别结果;其中,所述基于多模态重缩放注意力机制的模态协作融合网络包括依次连接的单模态编码模块、多模态重缩放注意力模块、池化拼接模块和多语种情感分类联合模块;所述单模态编码模块包括若干并联的单模态编码单元,每个单模态编码单元均包括依次连接的输入层、一维卷积层和正弦位置嵌入层;多模态重缩放注意力模块由以串联形式迭代的多个多模态重缩放注意力单元构成,每个多模态重缩放注意力单元包括线性层、引入正则约束和注意力外推因子的模态间重缩放协作层以及与所述模态间重缩放协作层的输出端均有连接且并联的多个单模态信息增强单元;所述多语种情感分类联合模块包括并行连接的情感分类器以及引入梯度反转层的语种对抗训练模块;所述情感分类器用于基于所述多模态联合表征,通过线性层输出情感识别结果;所述语种对抗训练模块用于引入梯度反转层对所述多模态联合表征进行语种对抗训练,完成跨语种深度语义对齐。
9.一种计算机设备,其特征在于:包括处理器和存储器,所述处理器与所述存储器相连,所述存储器用于存储计算机程序,所述处理器用于执行所述存储器中存储的计算机程序,以使得所述计算机设备执行如权利要求1至7中任一项所述的方法。