1.一种手语生成方法,其特征在于,包括:对说话人的语音音频中的每帧音频帧进行情感分类,确定所述语音音频对应的情感特征序列,以及,对说话人动作图片帧进行面部和手部的遮罩处理,得到所述说话人的遮罩图片,并对所述说话人动作图片帧进行面部识别,得到所述说话人的面部身份特征;基于所述语音音频、所述情感特征序列、所述说话人的遮罩图片和所述说话人的面部身份特征,利用预先确定的手语动作生成算法,生成所述说话人的遮罩图片中的说话人面部动作和手部动作,得到所述语音音频对应的说话人手语动作图片序列;其中,所述手语动作生成算法是利用预先录制的听障人士的手语动作视频进行手语动作生成学习确定的,以使所述手语动作生成算法学习所述听障人士的手语表达风格,所述说话人手语动作图片序列中的说话人面部动作和手部动作的风格与听障人士的手语表达风格相同。
2.根据权利要求1所述的方法,其特征在于,基于所述语音音频、所述情感特征序列、所述说话人的遮罩图片和所述说话人的面部身份特征,利用预先确定的手语动作生成算法,生成所述说话人的遮罩图片中的说话人面部动作和手部动作,得到所述语音音频对应的说话人手语动作图片序列,包括:基于所述语音音频和所述情感特征序列,确定所述语音音频对应的节奏幅度特征;基于所述说话人的遮罩图片、所述说话人的面部身份特征和所述语音音频对应的节奏幅度特征,生成所述说话人的遮罩图片中的说话人面部动作和手部动作,得到所述语音音频对应的说话人手语动作图片序列。
3.根据权利要求2所述的方法,其特征在于,基于所述说话人的遮罩图片、所述说话人的面部身份特征和所述语音音频对应的节奏幅度特征,生成所述说话人的遮罩图片中的说话人面部动作和手部动作,得到所述语音音频对应的说话人手语动作图片序列,包括:基于所述语音音频对应的节奏幅度特征,确定所述语音音频对应的动作光流特征;基于所述说话人的遮罩图片、所述说话人的面部身份特征和所述语音音频对应的动作光流特征,生成所述说话人的遮罩图片中的说话人面部动作和手部动作,得到所述语音音频对应的说话人手语动作图片序列。
4.根据权利要求1所述的方法,其特征在于,基于所述语音音频、所述情感特征序列、所述说话人的遮罩图片和所述说话人的面部身份特征,利用预先确定的手语动作生成算法,生成所述说话人的遮罩图片中的说话人面部动作和手部动作,得到所述语音音频对应的说话人手语动作图片序列,包括:将所述语音音频、所述情感特征序列、所述说话人的遮罩图片和所述说话人的面部身份特征均输入到预先训练的手语动作生成模型中,得到所述语音音频对应的说话人手语动作图片序列;所述手语动作生成模型是基于预先录制的听障人士的手语动作视频进行手语动作生成训练得到的。
5.根据权利要求4所述的方法,其特征在于,所述手语动作生成模型包括:节奏幅度特征编码器、光流特征编码器和手语动作生成器;将所述语音音频、所述情感特征序列、所述说话人的遮罩图片和所述说话人的面部身份特征均输入到预先训练的手语动作生成模型中,得到所述语音音频对应的说话人手语动作图片序列,包括:将所述语音音频和所述情感特征序列输入到所述节奏幅度特征编码器中,得到所述语音音频对应的节奏幅度特征;将所述语音音频对应的节奏幅度特征输入到所述光流特征编码器中,得到所述语音音频对应的动作光流特征;将所述说话人的遮罩图片、所述说话人的面部身份特征和所述语音音频对应的动作光流特征输入到所述手语动作生成器中,得到所述语音音频对应的说话人手语动作图片序列。
6.根据权利要求4所述的方法,其特征在于,所述手语动作生成模型的训练过程,包括:获取听障人士在不同情感状态下的样本音频对应的手语动作视频以及样本音频对应的样本情感特征;将所述手语动作视频中的视频帧进行面部和手部的遮罩处理,得到所述听障人士的样本遮罩图片,并对所述手语动作视频中的视频帧进行面部识别,得到所述听障人士的样本面部身份特征;将所述样本音频、所述样本情感特征、所述听障人士的样本遮罩图片和所述听障人士的样本面部身份特征输入到预先构建的手语动作生成模型中,得到所述样本音频对应的预测手语动作图片序列;基于所述样本音频对应的预测手语动作图片序列和样本手语动作图片序列之间的差异,对所述手语动作生成模型进行模型参数调整;其中,所述样本手语动作图片序列是对所述样本音频对应的手语动作视频进行抽帧得到的。
7.根据权利要求6所述的方法,其特征在于,将所述样本音频、所述样本情感特征、所述听障人士的样本遮罩图片和所述听障人士的样本面部身份特征输入到预先构建的手语动作生成模型中,得到所述样本音频对应的预测手语动作图片序列,包括:将所述样本音频和所述样本情感特征输入到节奏幅度特征编码器中,得到所述样本音频对应的样本节奏幅度特征,并基于标注节奏幅度特征和所述样本节奏幅度特征之间的差异,对所述节奏幅度特征编码器进行训练;其中,所述标注节奏幅度特征为对所述样本音频进行人工标注的节奏幅度特征;将所述样本音频对应的样本节奏幅度特征输入到光流特征编码器中,得到所述样本音频对应的样本动作光流特征;将所述样本动作光流特征、所述听障人士的样本遮罩图片和所述听障人士的样本面部身份特征输入到手语动作生成器中,得到所述样本音频对应的预测手语动作图片序列;基于所述样本动作光流特征和标注光流特征之间的差异,以及,所述预测手语动作图片序列和样本手语动作图片序列之间的差异,对所述光流特征编码器和所述手语动作生成器进行联合训练;其中,所述标注光流特征是通过对所述样本音频对应的手语动作视频进行光流特征提取得到的。
8.一种手语生成装置,其特征在于,包括:情感分类模块,用于对说话人的语音音频中的每帧音频帧进行情感分类,确定所述语音音频对应的情感特征序列;图片帧处理模块,用于对说话人动作图片帧进行面部和手部的遮罩处理,得到所述说话人的遮罩图片,并对所述说话人动作图片帧进行面部识别,得到所述说话人的面部身份特征;手语生成模块,用于基于所述语音音频、所述情感特征序列、所述说话人的遮罩图片和所述说话人的面部身份特征,利用预先确定的手语动作生成算法,生成所述说话人的遮罩图片中的说话人面部动作和手部动作,得到所述语音音频对应的说话人手语动作图片序列;其中,所述手语动作生成算法是利用预先录制的听障人士的手语动作视频进行手语动作生成学习确定的,以使所述手语动作生成算法学习所述听障人士的手语表达风格,所述说话人手语动作图片序列中的说话人面部动作和手部动作的风格与听障人士的手语表达风格相同。
9.一种电子设备,其特征在于,包括:存储器和处理器;所述存储器与所述处理器连接,用于存储程序;所述处理器,用于通过运行所述存储器中的程序,实现如权利要求1至7中任意一项所述的手语生成方法。
10.一种存储介质,其特征在于,所述存储介质上存储有计算机程序,所述计算机程序被处理器执行时,实现如权利要求1至7中任意一项所述的手语生成方法。
11.一种计算机程序产品,其特征在于,包括计算机程序指令,所述计算机程序指令在被处理器运行时使得所述处理器实现如权利要求1至7中任意一项所述的手语生成方法。