有效
基于深度学习的视频图像空间转换方法
黄魁华、杜航、程光权、黄金才、张勇、江禄民
中国人民解放军国防科技大学
摘要
本发明公开了基于深度学习的视频图像空间转换方法,包括以下步骤:将视频信息输入到特征提取网络中,获得时间和内容信息的多尺度特征信息;将所述的多尺度特征信息输入到多尺度叶层分类网络,使用叶层分类网络对提取到的多尺度特征表示进行分类,确保在不同尺度上能够精确捕捉到图像的局部和全局信息;通过全像素关联网络,计算输入帧之间的相关体积,并通过迭代更新得到光流估计;通过对比学习,在时间和空间维度上优化视频转换效果;通过循环一致性优化保证生成的视频序列的整体一致性;使用生成器生成目标图像,并通过判别器评估生成图像的质量;采用生成的高质量图像转换为视频输出。
1.基于深度学习的视频图像空间转换方法,其特征在于,包括以下步骤:步骤1,将视频信息输入到特征提取网络中,获得时间和内容信息的多尺度特征信息;步骤2,将所述的多尺度特征信息输入到多尺度叶层分类网络,使用叶层分类网络对提取到的多尺度特征信息进行分类,确保在不同尺度上能够精确捕捉到图像的局部和全局信息;步骤3,通过全像素关联网络,计算输入帧之间的相关体积,并通过迭代更新得到光流估计;步骤4,通过对比学习,在时间和空间维度上优化视频转换效果;通过循环一致性优化保证生成的视频序列的整体一致性;步骤5,使用生成器生成目标图像,并通过判别器评估生成图像的质量;步骤6,采用生成的高质量图像转换为视频输出;步骤5中所述的使用生成器生成目标图像,包括以下步骤:生成器首先从输入图像中提取多尺度特征,然后结合叶层分类网络的分类结果,对这些特征进行结构约束和融合,确保生成器在生成图像时,保留了图像的空间几何特征和层次结构;在融合了空间结构信息后,生成器进一步参考全像素关联网络提供的光流场信息,通过光流引导,生成器生成的目标图像在时间序列上保持运动一致性,并且对动态变化的部分进行运动补偿和调整;最后,生成器利用空间结构和时间动态融合的信息,通过一系列的卷积和反卷积操作,生成目标图像;步骤5中所述的通过判别器评估生成图像的质量,包括以下步骤:空间结构检查,判别器将生成图像的特征与叶层分类网络的输出进行比较,检查图像是否在空间结构上与原始图像保持一致;时间动态检查,判别器利用全像素关联网络的光流信息,评估生成图像与相邻帧之间的运动一致性;判别器将空间结构检查和时间动态检查的结果进行综合评估,生成一个最终的判别结果,输出图像的质量评分,如果生成图像在这两方面都表现良好,则判别器会给出较高的质量评分,反之则为较低的质量评分。
2.根据权利要求1所述的基于深度学习的视频图像空间转换方法,其特征在于,所述的特征提取网络的输入为单帧视频图像 ,大小为 ,其中 和 分别表示图像的高度和宽度,3表示RGB颜色通道,输出为一组多尺度的特征图,所述的特征提取网络的计算步骤包括以下:步骤101,通过初始卷积层对输入图像进行卷积操作,提取出基本的空间特征,获得初始特征图;步骤102,对初始特征图进行多次卷积,生成一系列中间特征图;步骤103,在不同尺度上提取特征,通过不同大小的卷积核或池化操作,生成多尺度的特征图;步骤104,将在不同尺度上提取的特征图进行融合,生成最终的多尺度特征图。
3.根据权利要求1所述的基于深度学习的视频图像空间转换方法,其特征在于,所述的使用叶层分类网络对提取到的多尺度特征信息进行分类,包括以下步骤:步骤201,对输入的多尺度特征图进行卷积操作,以捕捉特征图中的局部模式,并生成初步的叶层表示;步骤202,对卷积后的特征图进行池化,以降低特征图的维度,同时保留最重要的空间信息;步骤203,将池化后的特征图展平,并通过全连接层进一步处理,以提取全局模式;步骤204,将展平后的特征向量输入至分类层,通过Softmax激活函数输出叶层的类别概率。
4.根据权利要求1所述的基于深度学习的视频图像空间转换方法,其特征在于,所述的通过全像素关联网络,计算输入帧之间的相关体积,并通过迭代更新得到光流估计,包括以下步骤:步骤301,对输入的图像帧 和 的多尺度特征图进行提取,作为关联计算的基础;步骤302,计算输入图像帧对之间的所有像素对的相关性,生成4D相关体积;步骤303,在不同尺度上对4D相关体积进行处理,并通过循环单元GRU不断迭代更新光流估计;步骤304,根据更新后的4D相关体积,用卷积操作对更新后的光流估计进行处理,生成最终的光流场,即每个像素的运动向量。
5.根据权利要求4所述的基于深度学习的视频图像空间转换方法,其特征在于,步骤302中,对每个特征图中的每个像素,计算与图像帧对中另一个特征图中所有像素的内积,生成一个4D相关体积 ,其计算公式为:其中, 表示第 个像素在 中与第 个像素在 中的相关性, 是特征维度的索引, 和 分别是从 和 提取的多尺度特征图, 表示 中第 个像素第 特征维度的特征值, 表示 中第 个像素第 的特征值;步骤303中,通过不同尺度的相关体积进行匹配和关联,并通过循环更新光流估计,将相关体积 进行池化,生成不同分辨率的多尺度相关体积,使用循环神经网络GRU对相关体积进行迭代更新,每次更新光流估计,计算公式: ,其中, 表示第 次迭代的光流估计, 是更新后的光流增量, 表示第 次迭代的光流估计。
6.根据权利要求5所述的基于深度学习的视频图像空间转换方法,其特征在于,所述的4D相关体积的生成包括以下步骤:提取两个连续的图像帧 和 的多尺度特征图中每个像素位置的特征向量: ,其中, 表示图像帧 中位置 的特征向量, 表示图像帧 中位置 的特征向量, 是特征维度, 表示实数;计算两个特征向量之间的相似性,使用内积作为相似性的度量;对于每对像素位置 和 ,计算它们特征向量的内积, ,其中, 是4D相关体积中的一个元素,表示像素对 和 之间的相似性;将所有像素对的相似性计算结果组织成一个4D张量,即4D相关体积;通过遍历 和 中的所有像素位置,计算得到整个图像帧的4D相关体积 ;通过池化操作生成不同分辨率的4D相关体积,以捕捉不同尺度上的运动信息;对4D相关体积 进行池化操作,生成不同分辨率的4D相关体积 , ,其中, 是池化后的4D相关体积,包含了较低分辨率下的像素关联信息, 是 中的一个元素。
7.根据权利要求5或6所述的基于深度学习的视频图像空间转换方法,其特征在于,步骤304生成最终的光流场包括以下步骤:获得不同分辨率的4D相关体积 ;初始化光流估计 ,初始化为零向量或基于先前帧的光流场;使用循环神经网络GRU在不同尺度上迭代更新光流估计,使其逐渐逼近真实的光流场;在每一尺度 上,使用当前的光流估计 对应的像素位置,从4D相关体积 中检索关联信息,并通过GRU单元更新光流估计;在当前尺度上更新光流估计后,将其上采样到较高分辨率,以便在更高的尺度上继续迭代更新;在每个尺度 上完成光流更新后,使用双线性插值或卷积上采样将光流估计上采样到更高分辨率, 是在尺度 上采样后的光流估计;在所有尺度的迭代更新完成后,输出最终的光流估计结果;在最高分辨率上完成最后一次光流更新后,输出最终的光流场 。
8.根据权利要求7所述的基于深度学习的视频图像空间转换方法,其特征在于,所述的光流估计包括以下步骤:基于更新后的光流估计 和相关体积中的匹配信息,进一步细化光流场,确保高精度的运动估计;对每个像素位置 ,使用更新后的光流估计 在特征图 中定位对应位置,并从相关体积 中提取相应的匹配信息; ,其中, 是细化后的光流向量,Refine操作基于相关体积中的信息对光流进行细化;将细化后的光流场进行反向映射和一致性检查,以确保光流的双向一致性;对于每个像素位置 ,根据光流向量 计算其在上一帧中的对应位置 ;检查前向光流和反向光流的一致性,确保相对误差在一定范围内;应用平滑和正则化操作,以消除光流场中的噪声和不连续性,保证光流场的平滑性;对细化后的光流场使用高斯滤波或全局优化方法进行平滑处理;经过细化、一致性检查和平滑后的光流场,即为最终输出的光流场。
9.根据权利要求1所述的基于深度学习的视频图像空间转换方法,其特征在于,所述的通过对比学习,在时间和空间维度上优化视频转换效果,包括以下步骤:计算连续帧之间的时间相似性损失,以确保帧间运动的平滑性和一致性;对于相邻的两帧 和 ,根据光流估计 将 的特征向量映射回 的特征空间,并计算相似性损失, ,其中, 和 分别表示在时间 和 时刻的视频帧特征图, 是时间相似性损失, 是视频的总时长;基于时间相似性损失,通过反向传播优化生成器,调整视频转换模型的参数;使用Adam优化算法最小化时间相似性损失,调整生成器参数;计算同一帧内的空间相似性损失,确保帧内的空间结构和细节的一致性;在每一帧 内,选择多个像素对 和 ,计算这些像素对的特征向量之间的相似性; ,其中, 表示在时间 时刻,位置 的特征向量, 为空间相似性损失;基于空间相似性损失,通过反向传播优化生成器,调整视频转换模型的参数;使用优化算法最小化空间相似性损失,调整生成器参数;综合时间相似性和空间相似性损失,形成最终的优化目标;结合时间和空间相似性损失,构建总损失函数 , ,其中, 和 分别是时间相似性和空间相似性损失的权重;最小化总损失函数,优化视频转换模型的所有参数;所述的通过循环一致性优化保证生成的视频序列的整体一致性,包括以下步骤:使用生成器 将原始图像帧 转换为目标状态下的图像帧 ;使用反向生成器 将生成的图像帧 转换回原始状态,得到重建的图像帧 ;计算原始图像帧 和重建的图像帧 之间的像素级差异,作为循环一致性损失;通过反向传播最小化循环一致性损失 , ,其中, 和 分别表示图像帧 和 中位置 的像素值优化生成器 和反向生成器 的参数。



