1.一种基于模块化自编码的可控生成网络的训练方法,其特征在于,包括:获取训练数据,所述训练数据包括图像I以及图像I变换后得到的图像I′;基于所述训练数据,利用等变约束对卷积网络自编码器进行训练,得到训练好的自编码器;其中,等变约束L EC 采用如下公式进行计算:L equ =∑ i ||f′ (i) -M (i) (δ)f (i) || 2 ,i∈{0,1,...,k-1},L EC =L recon +λ 1 L equ +λ 2 L sym ,f=I*W,f′=I′*W,其中,I′=L δ (I),L δ 为某种变换且变换参数为δ;W为卷积网络自编码器的卷积核,且W=[W (0) ,W (1) ,...,W (k-1) ],即卷积核分为k个模块;f为图像I经过卷积后得到的特征图像,且f=[f (0) ,f (1) ,...,f (k-1) ];f′为图像I′经过卷积后得到的特征图像,f′=[f′ (0) ,f′ (1) ,...,f′ (k-1) ];*表示卷积操作, 表示反卷积操作;f (i) 为图像I经过卷积核的第i个模块卷积后得到的特征图;f′ (i) 为图像I′经过卷积核的第i个模块卷积后得到的特征图;M (i) (δ)为第i个模块参数为δ的预测矩阵,该预测矩阵通过随机初始化后经过模型训练优化得到;L recon 为重建损失,L equ 为等变损失,L sym 为对称损失,L EC 为等变约束;λ 1 和λ 2 分别为等变损失和对称损失的权重系数;l表示各个模块的维度数量; 表示第i个模块只有第m维为1其余维度为0的特征图, 表示第i个模块只有第n维为1其余维度为0的特征图; 为从 到 的最优变换参数; 为参数为δ预测矩阵M (i) (δ)的第m行第n列的值; 为参数为δ′的预测矩阵M (i) (δ′)的第m行第n列的值;T为一个大于0的超参数; 为变换参数为 时的预测矩阵;δ′为积分变量,用来区分不同积分项下的变换参数δ;基于预训练的潜在扩散模型构建针对k个不同模块的k个适配器;将训练数据中的图像I输入至训练好的自编码器中获得第i个模块的特征图f (i) ,i=0,1,2,...,k-1;利用得到的特征图f (i) 和如下所示的目标优化函数训练潜在扩散模型的第i个适配器:其中,z 0 是潜在扩散模型对于输入的图像I的潜在表征,z t 是在时间步t的加噪潜在表征,c txt 是文本提示,∈是满足分布为N(0,1)的实际添加的随机噪声,N(0,1)为均值为0方差为1的正态分布, 是通过优化参数θ预测的噪声, 表示预测的噪声 与实际添加的随机噪声∈的偏差的模的平方的期望,L mc (i) 为针对第i个模块特征图f (i) 的适配器的损失函数;将训练好的自编码器和训练好的适配器共同构成基于模块化自编码的可控生成网络。
2.如权利要求1所述的基于模块化自编码的可控生成网络的训练方法,其特征在于,所述变换包括平移变换或平移旋转变换。
3.一种基于模块化自编码的可控生成网络,其特征在于,采用如权利要求1-2任一项所述的方法训练得到。
4.一种基于模块化自编码的可控生成网络的训练装置,其特征在于,包括:训练数据获取模块,用于获取训练数据,所述训练数据包括图像I以及图像I变换后得到的图像I′;自编码器训练模块,用于基于所述训练数据,利用等变约束对卷积网络自编码器进行训练,得到训练好的自编码器;其中,等变约束L EC 采用如下公式进行计算:L equ =∑ i ||f′ (i) -M (i) (δ)f (i) || 2 ,i∈{0,1,...,k-1},L EC =L recon +λ 1 L equ +λ 2 L sym ,f=I*W,f′=I′*W,其中,I′=L δ (I),Lδ为某种变换且变换参数为δ;W为卷积网络自编码器的卷积核,且W=[W (0) ,W (1) ,...,W (k-1) ],即卷积核分为k个模块;f为图像I经过卷积后得到的特征图像,且f=[f (0) ,f (1) ,...,f (k-1) ];f′为图像I′经过卷积后得到的特征图像,f′=[f′ (0) ,f′ (1) ,...,f′ (k-1) ];*表示卷积操作, 表示反卷积操作;f (i) 为图像I经过卷积核的第i个模块卷积后得到的特征图;f′ (i) 为图像I′经过卷积核的第i个模块卷积后得到的特征图;M (i) (δ)为第i个模块参数为δ的预测矩阵,该预测矩阵通过随机初始化后经过模型训练优化得到;L recon 为重建损失,L equ 为等变损失,L sym 为对称损失,L EC 为等变约束;λ 1 和λ 2 分别为等变损失和对称损失的权重系数;l表示各个模块的维度数量; 表示第i个模块只有第m维为1其余维度为0的特征图, 表示第i个模块只有第n维为1其余维度为0的特征图; 为从 到 的最优变换参数; 为参数为δ预测矩阵M (i) (δ)的第m行第n列的值; 为参数为δ′的预测矩阵M (i) (δ′)的第m行第n列的值;T为一个大于0的超参数; 为变换参数为 时的预测矩阵;δ′为积分变量,用来区分不同积分项下的变换参数δ;适配器构建模块,用于基于预训练的潜在扩散模型构建针对k个不同模块的k个适配器;适配器训练模块,用于将训练数据中的图像I输入至训练好的自编码器中获得第i个模块的特征图f (i) ,i=0,1,2,...,k-1;利用得到的特征图f (i) 和如下所示的目标优化函数训练潜在扩散模型的第i个适配器:其中,z 0 是潜在扩散模型对于输入的图像I的潜在表征,z t 是在时间步t的加噪潜在表征,c txt 是文本提示,∈是满足分布为N(0,1)的实际添加的随机噪声,N(0,1)为均值为0方差为1的正态分布, 是通过优化参数θ预测的噪声, 表示预测的噪声 与实际添加的随机噪声∈的偏差的模的平方的期望,L mc (i) 为针对第i个模块特征图f (i) 的适配器的损失函数;可控生成网络构成模块,用于将训练好的自编码器和训练好的适配器共同构成基于模块化自编码的可控生成网络。
5.如权利要求4所述的基于模块化自编码的可控生成网络的训练装置,其特征在于,所述变换包括平移变换或平移旋转变换。
6.一种存储器,其特征在于,存储有多条指令,所述指令用于实现如权利要求1-2任一项所述的基于模块化自编码的可控生成网络的训练方法。
7.一种电子设备,其特征在于,包括处理器和与所述处理器连接的存储器,所述存储器存储有多条指令,所述指令可被所述处理器加载并执行,以使所述处理器能够执行如权利要求1-2任一项所述的基于模块化自编码的可控生成网络的训练方法。