有效

基于时空表征对齐的个性化视频生成模型训练和推理方法

高峰、王耀威、鲍秉坤、许轩诚
北京大学

摘要

本申请提出一种基于时空表征对齐的个性化视频生成模型训练和推理方法,包括:将第一图像数据输入扩散视频模型的空间变换器,得到第一图像数据对应的中间特征,基于中间特征和全局编码特征训练空间变换器;将第一视频数据输入扩散视频模型,获取扩散视频模型输出的第一视频数据对应的重建视频数据,基于每一帧视频数据对应的中间光流特征和标准光流特征训练时间变换器。本申请实施例通过全局编码特征对空间变换器进行训练,以增强模型全局监督和交互的能力,并通过标准光流特征对时间变化器进行训练以增强模型捕捉物体层面的运动的能力,从而提高模型生成视频中主体与运动模式的还原度。