1.基于空间感知解耦的文本到图像生成方法,其特征在于,方法包括以下步骤:接收训练数据集,将训练数据集输入至预先建立的空间感知生成对抗网络模型内进行训练,其中,所述训练数据集包括多个样本,每个样本内的文本数据与图像数据对应;所述预先建立的空间感知生成对抗网络模型包括文本编码器、空间感知图像码映射器、图像生成器和判别器;空间感知图像码映射器包含多个图像码调制模块和层特定适配器模块,所述生成器包含多个集成了双重融合模块的上采样生成块,所述判别器包含多个判别块和卷积层,所述图像码调制模块基于文本对初始图像码进行空间信息调制,所述层特定适配器模块用于将全局图像码转换为与图像生成器中不同层对应的层特定图像码,所述双重融合模块基于层特定图像码与增强文本向量分别进行空间与通道维度的融合;将文本数据基于文本编码器生成增强文本向量,将增强文本向量基于预先构建的空间感知图像码映射器生成层特定空间感知解耦的图像码,将层特定空间感知解耦的图像码与增强文本向量作为条件输入图像生成器中的每一层以生成文本对应图像,将文本对应图像输入至判别器内进行训练,以提升图像和文本匹配的判别能力为目标,输出得到训练后的空间感知生成对抗网络模型;接收待输入文本,将待输入文本输入至训练后的空间感知生成对抗网络模型内,输出得到输入文本的对应图像。
2.根据权利要求1所述的基于空间感知解耦的文本到图像生成方法,其特征在于,所述训练数据集内每一张图像对应一句或多句相应的文本描述,所述文本描述包括图像中的对象、形状及空间关系,训练数据集包括含单一物体的简单场景和含多个物体的复杂场景。
3.根据权利要求1所述的基于空间感知解耦的文本到图像生成方法,其特征在于,所述文本编码器采用预训练好的双向LSTM网络,所述预训练好的双向LSTM网络表达式如下:其中T为输入的文本,e为编码后的文本向量,将编码后的文本向量与随机噪声向量拼接,获得增强多样性的增强文本向量。
4.根据权利要求1所述的基于空间感知解耦的文本到图像生成方法,其特征在于,所述判别器区分过程包括:输入文本与真实图像、输入文本与生成图像,以及输入文本与不匹配的真实图像;其中,所述输入文本均相同,不匹配的真实图像为打乱与文本对应顺序后,随机抽取的真实图像;其中,将输入文本与真实图像输入至判别器内,判别器给予高分;将输入文本与生成图像输入至判别器内,判别器给予低分;将输入文本与不匹配的真实图像输入至判别器内,判别器给予低分,分数区间为-1到1之间,包含-1与1,-1为最低分,1为最高分。
5.根据权利要求4所述的基于空间感知解耦的文本到图像生成方法,其特征在于,所述判别器在训练时,采用铰链损失和梯度惩罚稳定训练过程。
6.根据权利要求1所述的基于空间感知解耦的文本到图像生成方法,其特征在于,所述预先建立的空间感知生成对抗网络模型的表达式如下:其中, 为判别器的损失, 为期望, 为输入图片, 为真实的图像数据分布, 为取最小值函数, 为判别器, 为与输入图片相匹配的文本向量, 为生成器, 为从高斯分布中采样的噪声向量, 为生成器生成的图像数据分布, 是和文本不匹配的图像, 是和文本不匹配的图像数据分布, 和 是梯度惩罚的两个超参数, 是范数, 是求偏导数操作, 为生成器的损失。
7.基于空间感知解耦的文本到图像生成系统,采用了权利要求1至6中任一项所述的基于空间感知解耦的文本到图像生成方法,其特征在于,包括:数据输入模块,用于接收训练数据集,将训练数据集输入至预先建立的空间感知生成对抗网络模型内进行训练,其中,所述训练数据集包括多个样本,每个样本内的文本数据与图像数据对应;所述预先建立的空间感知生成对抗网络模型包括文本编码器、空间感知图像码映射器、图像生成器和判别器;模型训练模块,用于将文本数据基于文本编码器生成增强文本向量,将增强文本向量基于预先构建的空间感知图像码映射器生成层特定空间感知解耦的图像码,将层特定空间感知解耦的图像码与增强文本向量作为条件输入图像生成器中的每一层以生成文本对应图像,将文本对应图像输入至判别器内进行训练,以提升图像和文本匹配的判别能力为目标,输出得到训练后的空间感知生成对抗网络模型;图像生成模块,用于接收待输入文本,将待输入文本输入至训练后的空间感知生成对抗网络模型内,输出得到输入文本的对应图像。
8.一种终端设备,包括存储器、处理器及存储在存储器中并能够在处理器上运行的计算机程序,其特征在于,所述存储器中存储有能够在处理器上运行的计算机程序,所述处理器加载并执行计算机程序时,采用了权利要求1至6中任一项所述的基于空间感知解耦的文本到图像生成方法。
9.一种计算机可读存储介质,所述计算机可读存储介质中存储有计算机程序,其特征在于,所述计算机程序被处理器加载并执行时,采用了权利要求1至6中任一项所述的基于空间感知解耦的文本到图像生成方法。