有效
一种基于知识蒸馏的动态统一序列图像生成方法
鲍秉坤、游思思、徐梦玲
南京邮电大学
摘要
本发明属于图像生成领域,公开一种基于知识蒸馏的动态统一序列图像生成方法,包括以下步骤:输入多个类别的宫格图像和文本信息并分别进行编码处理,获得编码后宫格图像和文本特征;对编码后的宫格图像进行加噪,并与文本特征拼接后输入预训练的自回归扩散模型中;学习不同类别宫格图像的布局特征和帧间连贯性,并设计稀疏掩码策略微调预训练的自回归扩散模型,把多个类别的宫格图像特征蒸馏到一个统一的矩阵中,输出帧间连贯的宫格图像;从帧间连贯的宫格图像中随机选取两帧图像输入图像扩写模型中,对两帧图像进行动态位置编码;解决了现有技术中存在着序列生成灵活性不足,且难以保证逻辑与视觉连贯性的问题。
1.一种基于知识蒸馏的动态统一序列图像生成方法,其特征在于,包括以下步骤:输入多个类别的宫格图像和文本信息并分别进行编码处理,获得编码后宫格图像和文本特征;对编码后的宫格图像进行加噪,并与文本特征拼接后输入预训练的自回归扩散模型中;学习不同类别宫格图像的布局特征和帧间连贯性,并设计稀疏掩码策略微调预训练的自回归扩散模型,把多个类别的宫格图像特征蒸馏到一个统一的矩阵中,输出帧间连贯的宫格图像;从帧间连贯的宫格图像中随机选取两帧图像输入图像扩写模型中,对两帧图像进行动态位置编码,并用动态位置编码更新图像扩写模型中待输出图像的位置信息;基于更新后的位置信息,微调图像扩写模型,生成所选取的两帧图像之间的中间图像特征,并由图像解码器解码输出动态统一序列图像;学习不同类别宫格图像的布局特征和帧间连贯性,并设计稀疏掩码策略微调预训练的自回归扩散模型,把多个类别的宫格图像特征蒸馏到一个统一的矩阵中,输出帧间连贯的宫格图像,具体包括以下步骤:采用卷积神经网络提取宫格图像中每帧图像的特征 x i , ;构建完整的宫格图像特征矩阵 , ,其中 n 为帧数, d 为特征维度;在预训练的自回归扩散模型的自注意力层投影矩阵 W 上叠加可学习低秩矩阵,形成适配后的权重矩阵 ,具体表达式为:其中, 为缩放系数; B 1 、 B 2 分别为针对四宫格图像和九宫格图像的可学习低秩矩阵; A 为四宫格图像和九宫格图像共用的低秩矩阵的上矩阵;确定低秩矩阵中参数,参数包括行范数、绝对值和;计算各低秩矩阵中参数的重要性分数,具体计算式如下:式中, 表示低秩矩阵 B 1 中参数的重要性分数; 表示低秩矩阵 B 2 中参数的重要性分数; 表示低秩矩阵 B 1 的第 i 行、第 j 列对应的值; 表示低秩矩阵 B 2 的第 i 行、第 j 列对应的值; r 是矩阵的秩;以低秩矩阵中行范数的重要性分数,分别对低秩矩阵 B 1 和低秩矩阵 B 2 中每一行进行排序;预先设定稀疏率 s ,低秩矩阵 B 1 和低秩矩阵 B 2 中各自保留前 k 行,其中 ;对其余行全部置零,并用掩码表示保留与否,形成稀疏化矩阵:其中, 表示掩码矩阵;⊙表示为 Hadamard 积; 和 分别为低秩矩阵 B 1 和低秩矩阵 B 2 所对应的稀疏化矩阵;通过序列建模网络捕获帧间动态关系,具体表达式如下:其中, 表示第 t 帧的上下文特征; 表示序列模型; 表示第 t -1帧的上下文特征;在微调的训练阶段,仅更新掩码保留的稀疏矩阵参数,通过梯度下降优化预训练的自回归扩散模型,将不同类别的图像特征蒸馏到稀疏后的矩阵中,输出帧间连贯的宫格图像;从帧间连贯的宫格图像中随机选取两帧图像输入图像扩写模型中,对两帧图像进行动态位置编码,具体包括以下步骤:从生成的帧间连贯的宫格图像中,通过滑动窗口机制随机选取两帧图像 和 ;对选定的两帧图像 和 分别生成时间位置编码 ,具体表达式如下:其中, ,表示图像帧序号;采用预训练的视觉特征提取器提取两帧图像的内容特征,具体表达式如下:其中, 为视觉特征提取器; , 分别为两个图像帧的内容特征;将时间位置编码与对应内容特征融合生成动态位置编码,具体表达式如下:其中, 和 表示特征拼接; 表示多层感知机或线性变换; 、 分别为图像 和 动态位置编码,且 。
2.根据权利要求1所述的基于知识蒸馏的动态统一序列图像生成方法,其特征在于,输入的宫格图像为2×2的四宫格图像或3×3的九宫格图像,且宫格图像均为连续多帧图像按空间顺序排列组成。
3.根据权利要求1所述的基于知识蒸馏的动态统一序列图像生成方法,其特征在于,宫格图像进行编码,具体包括以下步骤:对每张宫格图像进行预处理,预处理包括尺寸缩放、填充和归一化处理;预处理后的宫格图像按空间维度拆分为多个图像块组,每个图像块组包含连续排列的多幅图像;对各图像块组分别进行编码,得到对应的潜在空间特征表示;将各图像块组的潜在空间特征表示,按照宫格图像的原始空间排列顺序进行拼接组合,形成完整的输入特征表示,完成宫格图像编码。
4.根据权利要求3所述的基于知识蒸馏的动态统一序列图像生成方法,其特征在于,文本信息编码采用多模型联合方式处理,具体包括以下步骤:对输入的文本信息进行分词和掩码处理;将分词输入到第一编码器中,提取文本信息的全局语义表征;分词和掩码共同输入到第二编码器中,提取文本信息的细粒度上下文表征;将全局语义表征和细粒度上下文表征进行拼接融合,生成文本特征。
5.根据权利要求4所述的基于知识蒸馏的动态统一序列图像生成方法,其特征在于,预训练的自回归扩散模型采用 Flux 架构,通过逐步噪声迭代生成图像,具体包括正向扩散过程与反向去噪过程;正向扩散过程中,定义编码后的宫格图像为给定真实图像数据 ,在 T 步内逐步加噪,生成一系列的含噪声图像变量 ,其中 表示纯噪声图像;每一步的加噪的表达式为:其中, 表示从含噪声图像变量 加噪至含噪声图像变量 的分布; 表示第 步的噪声强度超参数; 表示每个像素维度的噪声; N 表示正态分布;通过数学推导,获得任意时刻 t 的含噪声图像变量 关于真实图像数据 的条件分布:其中, 表示第 s 步的噪声强度参数; 是第 t 步累计保留的原始信号比例; 表示在给定真实图像数据 的情况下,经过 t 步加噪声后得到的含噪声图像变量 的概率分布;反向去噪过程中的目标是从纯噪声图像 恢复到给定真实图像数据 ,反向去噪过程的表达式为:其中, 表示从含噪声图像变量 去噪至含噪声图像变量 的分布; 和 分别为自回归扩散模型预测的均值和噪声项;自回归扩散模型通过预测含噪声图像变量 的噪声项 ,并通过计算可获得反向去噪过程中含噪声图像变量 对应的均值 ,具体计算式如下:其中, 表示网络参数; 表示第 t 步的噪声强度参数;以最小化噪声预测的流匹配损失为目标对自回归扩散模型进行预训练,流匹配损失计算式如下:其中, L 表示流匹配损失; 表示输入的文本条件; 表示对多个变量 求期望值。
6.根据权利要求1所述的基于知识蒸馏的动态统一序列图像生成方法,其特征在于,用动态位置编码更新图像扩写模型中待输出图像的位置信息,具体包括以下步骤:图像扩写模型采用Transformer架构,位置信息更新的表达式如下:其中, 为第 t 时刻的图像隐空间表示; 为第 t- 1时刻的图像隐空间表示; 表示更新量,更新量 通过注意力机制计算:注意力机制公式表示为:其中, Q 、 K 和 V 分别代表query、key和value,由动态位置编码和隐空间特征表示 生成。
7.根据权利要求6所述的基于知识蒸馏的动态统一序列图像生成方法,其特征在于,基于更新后的位置信息,微调图像扩写模型,生成所选取的两帧图像之间的中间图像特征,并由图像解码器解码输出序列图像,具体包括以下步骤:输入图像扩写模型的两帧图像 和 填充于四宫格中,图像 位于四宫格的左上角, 位于四宫格的左下角;四宫格的右上角、右下角为非条件区域,即需预测生成的中间图像;将条件区域图像 和 编码为对应图像特征 和 后,对非条件区域的中间图像 进行加噪处理,得到任意时间步 t 的噪声级别的图像特征 ,递归扩散后解码获得最终的图像;图像扩写模型的目标是预测时间步 t 时,图像特征 的无噪版本,通过重构损失函数 微调图像扩写模型,重构损失函数 表达式如下:其中, ,表示模型预测的无噪版本图像; c 表示图像 和 ; 为采样的高斯噪声; 表示时间步 t 时的中间图像特征; 表示时间步 t- 1时的中间图像特征; 表示对变量 和 的期望, ∼ 表示一个服从均值为 0、协方差为单位矩阵I的多维正态分布的随机噪声;通过动态位置编码和时间注意力机制,引入时序一致性损失确保生成的中间帧序列在时间维度上的平滑性和连贯性,时序一致性损失函数 表达式如下:其中, 和 分别表示第 t 步和第 t +1步时的图像特征;引入全局特征对齐约束,确保生成序列的整体动态特征一致性,整体动态特征一致性损失函数 表达式如下:其中, 为全局特征提取网络, 为生成的图像序列;各损失共同构成组合损失函数 ,组合损失函数 表达式如下:其中, , 和 为可学习的权重;通过上述优化过程,微调后的图像扩写模型最终输出两帧图像特征 和 之间的中间图像特征 ;最后由图像解码器对中间图像特征 解码成完整的动态统一图像序列,具体表达式如下:其中, 为图像解码器; 表示动态统一序列图像。



