有效
基于时空表征对齐的个性化视频生成模型训练和推理方法
高峰、王耀威、鲍秉坤、许轩诚
北京大学
摘要
本申请提出一种基于时空表征对齐的个性化视频生成模型训练和推理方法,包括:将第一图像数据输入扩散视频模型的空间变换器,得到第一图像数据对应的中间特征,基于中间特征和全局编码特征训练空间变换器;将第一视频数据输入扩散视频模型,获取扩散视频模型输出的第一视频数据对应的重建视频数据,基于每一帧视频数据对应的中间光流特征和标准光流特征训练时间变换器。本申请实施例通过全局编码特征对空间变换器进行训练,以增强模型全局监督和交互的能力,并通过标准光流特征对时间变化器进行训练以增强模型捕捉物体层面的运动的能力,从而提高模型生成视频中主体与运动模式的还原度。
1.一种基于时空表征对齐的个性化视频生成模型训练方法,其特征在于,包括:将第一图像数据输入扩散视频模型的空间变换器,得到所述第一图像数据对应的中间特征,所述第一图像数据为输入数据集中的任一图像数据,所述中间特征为所述空间变换器输出的不同尺度的特征图中最大尺度的特征图;将所述第一图像数据输入训练好的自监督编码器,得到所述第一图像数据对应的全局编码特征,所述全局编码特征包括所述第一图像数据的上下文信息,所述中间特征和所述全局编码特征用于提取所述第一图像数据中的主体信息;基于所述中间特征和所述全局编码特征训练所述扩散视频模型的空间变换器;将第一视频数据输入所述扩散视频模型,获取所述扩散视频模型输出的所述第一视频数据对应的重建视频数据,所述第一视频数据为所述输入数据集中的任一视频数据;将所述第一视频数据和所述重建视频数据分别输入预训练的光流编码器,得到所述第一视频数据中每一帧视频数据对应的中间光流特征和标准光流特征,所述中间光流特征和所述标准光流特征用于捕捉所述第一视频数据的运动信息;基于所述每一帧视频数据对应的中间光流特征和标准光流特征训练所述扩散视频模型的时间变换器;基于训练好的空间变换器和训练好的时间变换器,组合得到训练好的扩散视频模型。
2.根据权利要求1所述的方法,其特征在于,所述基于所述中间特征和所述全局编码特征训练所述空间变换器,包括:计算所述中间特征和所述全局编码特征的关系图;对所述关系图和所述全局编码特征进行融合,得到融合特征;基于所述融合特征和所述全局编码特征,生成第一损失函数值;基于所述第一损失函数值训练所述空间变换器。
3.根据权利要求2所述的方法,其特征在于,所述方法还包括:获取所述扩散视频模型基于所述第一图像数据得到的重建图像,所述重建图像包括预测掩码;将所述第一图像数据输入训练好的掩码生成模型,得到目标掩码;基于所述预测掩码和所述目标掩码生成第二损失函数值;所述基于所述第一损失函数值训练所述空间变换器,包括:基于所述第一损失函数值和所述第二损失函数值调整所述空间变换器的空间低秩矩阵,继续训练,直到满足第一训练完成条件,得到训练好的空间变换器。
4.根据权利要求1所述的方法,其特征在于,所述基于所述每一帧视频数据对应的中间光流特征和标准光流特征训练所述扩散视频模型的时间变换器,包括:针对任一帧视频数据的第一中间光流特征和第一标准光流特征,计算第三损失函数值;基于所述第三损失函数值训练所述扩散视频模型的时间变换器。
5.根据权利要求4所述的方法,其特征在于,所述方法还包括:获取第一视频数据的第一锚视频帧数据和所述第一视频数据对应重建图像数据的第二锚视频帧数据,所述第一锚视频帧数据为所述第一视频数据中任一视频帧数据,所述第二锚视频帧数据为所述重建图像数据中与所述第一锚视频帧数据的帧数一致的视频帧数据;将所述第一视频数据和所述重建图像数据分别输入编码器,获取所述第一视频数据中每帧视频数据的目标隐空间表征、所述第一锚视频帧数据的第一锚特征、所述重建图像数据中每帧视频数据的预测隐空间表征以及所述第二锚视频帧数据对应的第二锚特征;基于所述第一视频数据中每帧视频数据的目标隐空间表征和所述第一锚特征确定所述第一视频数据中每帧视频数据的目标运动特征;基于所述重建图像数据中每帧视频数据的预测隐空间表征和所述第二锚特征确定所述重建图像数据中每帧视频数据的预测运动特征;基于所述预测运动特征和所述目标运动特征计算第四损失函数值;所述基于所述第三损失函数值训练所述扩散视频模型的时间变换器,包括:基于所述第三损失函数值和所述第四损失函数值调整时间变换器的时间低秩矩阵,继续训练,直到满足第二训练完成条件,得到训练好的时间变换器。
6.根据权利要求1-5任一项所述的方法,其特征在于,所述方法还包括:从图像数据集中提取出主体为运动类别的目标图像数据;从视频数据集中提取出主体数量为一的目标视频数据;对所述目标图像数据和所述目标视频数据进行预处理,得到所述输入数据集。
7.一种基于时空表征对齐的个性化视频生成模型推理方法,其特征在于,包括:将目标数据集输入至训练好的扩散视频模型,所述训练好的扩散视频模型为基于权利要求1-6中任一项的所述基于时空表征对齐的个性化视频生成模型训练方法得到的,所述目标数据集包括目标图像数据和目标视频数据;通过所述训练好的扩散视频模型中空间变换器提取所述目标图像数据的目标图像特征,以及通过所述训练好的扩散视频模型中时间变换器提取所述目标视频数据中每一帧目标图像数据的目标光流特征,所述目标图像特征用于提取所述目标图像数据中的主体信息,所述目标光流特征用于捕捉所述目标图像数据的运动信息;通过所述训练好的扩散视频模型基于所述目标图像特征和每一帧目标图像数据的目标光流特征,输出目标视频。
8.根据权利要求7所述的方法,其特征在于,所述通过所述训练好的扩散视频模型中空间变换器提取所述目标图像数据的目标图像特征,以及通过所述训练好的扩散视频模型中时间变换器提取所述目标视频数据中每一帧目标图像数据的目标光流特征,包括:获取第一原始权重和第二原始权重,所述第一原始权重为所述训练好的扩散视频模型中空间变化器的目标空间低秩矩阵对应的原始权重,所述第二原始权重为所述训练好的扩散视频模型中时间变换器的目标空间低秩矩阵对应的原始权重;在当前时间步小于等于预设时间步的情况下,调整所述目标空间低秩矩阵的第一运行权重低于所述第一原始权重;通过调整第一运行权重后的空间变化器提取所述目标图像数据的目标图像特征;在当前时间步大于所述预设时间步的情况下,调整所述目标空间低秩矩阵的第一运行权重逐渐增加至所述第一原始权重;通过调整第一运行权重后的空间变化器提取所述目标图像数据的目标图像特征;在任一时间步,通过运行权重为第二运行权重的时间变化器提取所述目标视频数据中每一帧目标图像数据的目标光流特征。
9.一种电子设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器运行所述计算机程序以实现如权利要求1-8任一项所述的方法。
10.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述程序被处理器执行实现如权利要求1-8中任一项所述的方法。




