1.一种基于多模态特征和对比学习的语音情感识别方法,其特征在于,所述方法包括:获取待识别的语音视频数据;所述语音视频数据中包括语音文本和视频数据;构建的语音情感识别模型;所述语音情感识别模型包括Fast RCNN预处理模型、双向GRU模型、3D卷积网络和全连阶层;对所述语音文本进行数据预处理,得到语音向量和词向量;利用Fast RCNN预处理模型将所述视频数据中说话人的局部特征提取出来,并扩充尺寸后与所述视频数据的全局特征图进行融合,得到融合视频数据;所述局部特征包括脸部表情和手部动作;根据双向GRU模型分别对所述语音向量和词向量进行情感特征提取,得到语音情感特征和文本情感特征;利用3D卷积网络对所述融合视频数据进行情感特征提取,得到高级情感特征;根据对比学习方法对所述语音情感特征、文本情感特征和高级情感特征进行增强表示,得到增强后的语音情感特征、文本情感特征和高级情感特征;将所述增强后的语音情感特征、文本情感特征和高级情感特征进行拼接,并通过全连接层组成的解码器进行解码,输出情感类别的概率分布;根据所述情感类别的概率分布和标注的真实情感类别标签构建交叉熵损失函数,利用所述交叉熵损失函数和对比学习中的损失函数对预先构建的语音情感识别模型进行训练,得到训练好的语音情感识别模型;根据所述训练好的语音情感识别模型对所述待识别的语音视频数据进行语音情感识别。
2.根据权利要求1所述的方法,其特征在于,所述语音文本中包含语音数据和文本数据;对所述语音文本进行数据预处理,得到语音向量和词向量,包括:将所述语音数据按照固定时间段长度的窗口作为一帧,向后滑动窗口,每次移动后的窗口与前一个窗口位置都存在重叠部分,得到多个单帧语音数据;根据OpenSMILE工具对所述单帧语音数据进行转化,得到语音向量;将所述文本数据中包含词语最多的句子长度作为最大长度,对所述文本数据中不足最大长度的句子进行零填充处理,得到多个等长的句子;根据Bert预处理模型对所述等长的句子中的词语进行转化,得到词向量;所述词向量中包含其对应的词语的上下文的语义信息。
3.根据权利要求1所述的方法,其特征在于,根据双向GRU模型分别对所述语音向量和词向量进行情感特征提取,得到语音情感特征和文本情感特征,包括:根据双向GRU模型,将所述语音向量和词向量分别同时输入一个正向和一个反向的GRU模型,将两个GRU模型相同时刻输出的状态信息向量进行拼接,得到分别对应的语音情感特征和文本情感特征。
4.根据权利要求1至3任意一项所述的方法,其特征在于,根据对比学习方法对所述语音情感特征、文本情感特征和高级情感特征进行增强表示,得到增强后的语音情感特征、文本情感特征和高级情感特征,包括:根据对比学习方法通过训练缩小损失函数来拉近语音情感特征、文本情感特征和高级情感特征之间的距离,得到增强后的语音情感特征、文本情感特征和高级情感特征。
5.根据权利要求4所述的方法,其特征在于,所述损失函数为loss cons =log(exp(D(S,T)/τ)+exp(D(S,V)/σ)),其中D为L2距离函数来测量两个情感特征表示的距离,S为语音情感特征,T为文本情感特征,V为高级情感特征,τ和σ是调节特征表示水平的参数。
6.根据权利要求1所述的方法,其特征在于,将所述增强后的语音情感特征、文本情感特征和高级情感特征进行拼接,并通过全连接层组成的解码器进行解码,输出情感类别的概率分布,包括:将所述增强后的语音情感特征、文本情感特征和高级情感特征进行拼接,并通过全连接层组成的解码器进行解码,输出情感类别的概率分布为其中,F r 表示拼接后的多模态特征,p j 表示当前所识别情感是第j个类别的概率, 为多模态特征的第j个特征参数, 为多模态特征的第i个特征参数。
7.根据权利要求6所述的方法,其特征在于,根据所述情感类别的概率分布和标注的真实情感类别标签构建交叉熵损失函数,包括:根据所述情感类别的概率分布和标注的真实情感类别标签构建交叉熵损失函数为其中,y表示情感类别的真实分布,x表示情感类别标签,n表示情感类别标签个数,i表示情感类别标签序号。
8.一种基于多模态特征和对比学习的语音情感识别装置,其特征在于,所述装置包括:模型构建模块,用于获取待识别的语音视频数据;所述语音视频数据中包括语音文本和视频数据;构建的语音情感识别模型;所述语音情感识别模型包括Fast RCNN预处理模型、双向GRU模型、3D卷积网络和全连阶层;数据预处理模块,用于对所述语音文本进行数据预处理,得到语音向量和词向量;利用Fast RCNN预处理模型将所述视频数据中说话人的局部特征提取出来,并扩充尺寸后与所述视频数据的全局特征图进行融合,得到融合视频数据;所述局部特征包括脸部表情和手部动作;特征提取模块,用于根据双向GRU模型分别对所述语音向量和词向量进行情感特征提取,得到语音情感特征和文本情感特征;利用3D卷积网络对所述融合视频数据进行情感特征提取,得到高级情感特征;对比学习模块,用于根据对比学习方法对所述语音情感特征、文本情感特征和高级情感特征进行增强表示,得到增强后的语音情感特征、文本情感特征和高级情感特征;将所述增强后的语音情感特征、文本情感特征和高级情感特征进行拼接,并通过全连接层组成的解码器进行解码,输出情感类别的概率分布;语音情感识别模块,用于根据所述情感类别的概率分布和标注的真实情感类别标签构建交叉熵损失函数,利用所述交叉熵损失函数和对比学习中的损失函数对预先构建的语音情感识别模型进行训练,得到训练好的语音情感识别模型;根据所述训练好的语音情感识别模型对所述待识别的语音视频数据进行语音情感识别。
9.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至7中任一项所述方法的步骤。
10.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至7中任一项所述的方法的步骤。