1.一种关于虚拟形象的音视频生成方法,其特征在于,包括:基于虚拟形象的基准形象数据进行特征提取,得到视觉特征序列,以及基于所述虚拟形象待播报的音频数据进行特征提取,得到音频特征序列;基于第一扩散生成网络处理所述视觉特征序列和所述音频特征序列,得到目标隐层表示;基于第二扩散生成网络处理所述目标隐层表示,得到音频隐层表示,以及基于第三扩散生成网络处理所述目标隐层表示,得到视频隐层表示;其中,所述第一扩散生成网络、所述第二扩散生成网络和所述第三扩散生成网络在扩散过程中共享时间步长;基于所述音频隐层表示进行解码,得到目标音频序列,以及基于所述视频隐层表示进行解码,得到目标视频序列;基于所述目标音频序列和所述目标视频序列进行融合,得到关于所述虚拟形象的目标音视频。
2.根据权利要求1所述的方法,其特征在于,在所述基于第一扩散生成网络处理所述视觉特征序列和所述音频特征序列,得到目标隐层表示之前,所述方法还包括:基于所述基准形象数据和待播报内容,生成场景动作描述;其中,所述场景动作描述表征所述虚拟形象在播报所述待播报内容时匹配的场景描述以及对应的动作描述;所述基于第一扩散生成网络处理所述视觉特征序列和所述音频特征序列,得到目标隐层表示,包括:将所述场景动作描述转化为与所述第一扩散生成网络维度匹配的第一嵌入向量;基于所述视觉特征序列、所述音频特征序列和所述第一嵌入向量进行融合,得到第一融合特征;基于所述第一扩散生成网络处理所述第一融合特征,得到目标隐层表示。
3.根据权利要求2所述的方法,其特征在于,在所述基于所述基准形象数据和待播报内容,生成场景动作描述之后,所述基于第二扩散生成网络处理所述目标隐层表示,得到音频隐层表示,包括:将所述场景动作描述转化为与所述第二扩散生成网络维度匹配的第二嵌入向量;基于所述目标隐层表示和所述第二嵌入向量进行融合,得到第二融合特征;基于所述第二扩散生成网络处理所述第二融合特征,得到音频隐层表示;和/或,所述基于第三扩散生成网络处理所述目标隐层表示,得到视频隐层表示,包括:将所述场景动作描述转化为与所述第三扩散生成网络维度匹配的第三嵌入向量;基于所述目标隐层表示和所述第三嵌入向量进行融合,得到第三融合特征;基于所述第三扩散生成网络处理所述第三融合特征,得到视频隐层表示。
4.根据权利要求2所述的方法,其特征在于,所述基于所述基准形象数据和待播报内容,生成场景动作描述,包括:基于所述基准形象数据和所述待播报内容,构建得到大模型指令;其中,所述大模型指令用于指示大语言模型生成与所述基准形象数据和所述待播报内容相匹配的场景动作描述文本;获取所述大语言模型响应所述大模型指令的输出文本,作为所述场景动作描述。
5.根据权利要求1所述的方法,其特征在于,在所述基于虚拟形象的基准形象数据进行特征提取,得到视觉特征序列之前,所述方法还包括:获取指示音视频生成的参考视频;所述基于虚拟形象的基准形象数据进行特征提取,得到视觉特征序列,包括:基于所述基准形象数据和所述参考视频进行特征提取,得到视觉特征序列。
6.根据权利要求1所述的方法,其特征在于,在所述基于第一扩散生成网络处理所述视觉特征序列和所述音频特征序列,得到目标隐层表示之前,所述方法还包括:获取指示音视频生成的参考音频,并提取所述参考音频的参考声学特征;所述基于第一扩散生成网络处理所述视觉特征序列和所述音频特征序列,得到目标隐层表示,包括:基于第一扩散生成网络处理所述视觉特征序列、所述音频特征序列和所述参考声学特征,得到目标隐层表示。
7.根据权利要求1所述的方法,其特征在于,所述基于第二扩散生成网络处理所述目标隐层表示,得到音频隐层表示,包括:基于所述目标隐层表示和所述音频特征序列进行融合,得到第四融合特征;基于第二扩散生成网络处理所述第四融合特征,得到音频隐层表示。
8.根据权利要求1至7任一项所述的方法,其特征在于,所述目标音视频由目标合成系统生成,所述目标合成系统包括音视频生成模型,所述音视频生成模型包括顺序连接的数据输入模块、数据处理模块、数据解码模块和数据输出模块,所述数据输入模块包括视觉编码网络和音频编码网络,所述数据处理模块包括第一扩散生成网络以及分别与所述第一扩散生成网络输出端连接的第二扩散生成网络和第三扩散生成网络,所述数据解码模块包括与所述第二扩散生成网络输出端连接的音频解码网络、与所述第三扩散生成网络输出端连接的视频解码网络。
9.一种关于虚拟形象的音视频生成装置,其特征在于,包括:特征提取模块,用于基于虚拟形象的基准形象数据进行特征提取,得到视觉特征序列,以及基于所述虚拟形象待播报的音频数据进行特征提取,得到音频特征序列;第一处理模块,用于基于第一扩散生成网络处理所述视觉特征序列和所述音频特征序列,得到目标隐层表示;第二处理模块,用于基于第二扩散生成网络处理所述目标隐层表示,得到音频隐层表示,以及基于第三扩散生成网络处理所述目标隐层表示,得到视频隐层表示;其中,所述第一扩散生成网络、所述第二扩散生成网络和所述第三扩散生成网络在扩散过程中共享时间步长;特征解码模块,用于基于所述音频隐层表示进行解码,得到目标音频序列,以及基于所述视频隐层表示进行解码,得到目标视频序列;序列融合模块,用于基于所述目标音频序列和所述目标视频序列进行融合,得到关于所述虚拟形象的目标音视频。
10.一种电子设备,其特征在于,至少包括存储器与处理器,所述存储器中至少存储有程序指令,所述处理器用于执行所述程序指令以实现权利要求1至8任一项所述的关于虚拟形象的音视频生成方法。
11.一种计算机可读存储介质,其特征在于,存储有能够被处理器运行的程序指令,所述程序指令用于实现权利要求1至8任一项所述的关于虚拟形象的音视频生成方法。