有效
图像生成模型训练方法、装置、计算机设备及存储介质
高峰、鲍秉坤、盛业斐
北京大学
摘要
本申请提出一种图像生成模型训练方法、装置、计算机设备及存储介质,该图像生成模型训练方法包括:预定义多个图像文本对;基于多个图像文本对训练得到初始生成模型的评估模型;评估模型用于评估初始生成模型的输出图像的图像质量以及语义一致性;对原始输入文本的三元组信息进行编码得到第一文本特征向量,对原始输入文本进行编码得到第二文本特征向量,将第一文本特征向量和第二文本特征向量进行融合得到融合文本特征向量;将融合文本特征向量输入至初始生成模型中得到目标图像;根据目标图像的评估值优化初始生成模型的模型参数,得到训练好的图像生成模型。本申请能够准确捕捉文本内容中的语义交互关系,使得生成图像的语义表达更加精准。
1.一种图像生成模型训练方法,其特征在于,所述方法包括:预定义多个图像文本对;每个图像文本对中的图像信息与文本信息相匹配;基于所述多个图像文本对训练得到初始生成模型的评估模型;所述评估模型用于评估所述初始生成模型的输出图像的图像质量以及语义一致性;对原始输入文本的三元组信息进行编码得到第一文本特征向量,对所述原始输入文本进行编码得到第二文本特征向量,以及将所述第一文本特征向量和所述第二文本特征向量进行融合得到融合文本特征向量;所述原始输入文本是指任一图像文本对中的文本信息;所述三元组信息包括主语文本信息、谓语文本信息和宾语文本信息;将所述融合文本特征向量输入至所述初始生成模型中得到目标图像;所述初始生成模型用于对随机噪声图像进行多步图像处理得到所述目标图像;所述图像处理包括图像去噪以及图像评估;每一步的图像去噪是基于前一步的去噪图像以及所述融合文本特征向量进行的,每一步的图像评估是指通过所述评估模型对当前步的去噪图像的图像质量以及语义一致性进行评估得到评估值;所述目标图像的评估值大于预设评估阈值;根据所述目标图像的评估值优化所述初始生成模型的模型参数,得到训练好的图像生成模型。
2.根据权利要求1所述的方法,其特征在于,预定义多个图像文本对,包括:获取多个图文对;每个图文对包括一个图像信息以及与所述图像信息对应的文本信息;针对任一图文对,对所述图文对中的文本信息进行编码得到文本特征向量,以及对所述图文对中的图像信息进行编码得到图像特征向量;计算所述文本特征向量和所述图像特征向量的相似度,如果所述相似度大于预设相似阈值,则确定所述文本信息和所述图像信息相匹配;根据所述文本信息和所述图像信息的匹配程度从所述多个图文对中筛选出所述多个图像文本对。
3.根据权利要求2所述的方法,其特征在于,在获取多个图像文本对之后,所述方法包括:响应于人工标注指令,从所述多个图像文本对中筛选出与所述人工标注指令对应的目标图像文本对;根据所述人工标注指令中的图文匹配得分确定所述目标图像文本对的第一得分;将所述目标图像文本对的数据来源作为权重因子,对所述第一得分进行加权计算,得到所述目标图像文本对的第二得分。
4.根据权利要求1或2所述的方法,其特征在于,基于所述多个图像文本对训练得到初始生成模型的评估模型,包括:针对所述多个图像文本对中的任一图像文本对,将所述图像文本对中的文本信息输入至所述初始生成模型中得到生成图像;计算所述生成图像的评估值,得到与所述多个图像文本对一一对应的多个生成图像的评估值;通过预设损失函数进行模型训练得到所述评估模型;其中,所述预设损失函数用于使所述多个生成图像的评估值之和最大化。
5.根据权利要求4所述的方法,其特征在于,计算所述生成图像的评估值,包括:将所述生成图像与所述图像文本对中的图像信息进行比较得到图像质量得分;计算所述生成图像的第一特征向量与所述图像文本对中的文本信息的第二特征向量的语义一致性得分;根据所述图像质量得分、与所述图像质量得分对应的第一权重系数、所述语义一致性得分,以及与所述语义一致性得分对应的第二权重系数,计算所述生成图像的评估值。
6.根据权利要求1或2所述的方法,其特征在于,所述方法还包括:通过以下步骤生成所述原始输入文本的三元组信息:对所述原始输入文本中的每个词进行词性标注,所述词性标注用于识别每个词在句子中的语法角色;将所述原始输入文本中的每个词作为一个节点,将词与词之间的关系作为节点之间的有向边,构建句法树;从所述句法树中筛选出谓语信息,并从所述谓语信息的上下文节点中筛选出与所述谓语信息相关联的主语信息和宾语信息;通过所述谓语信息、所述主语信息和所述宾语信息生成所述三元组信息。
7.根据权利要求1或2所述的方法,其特征在于,所述模型参数包括:由所述初始生成模型的权重矩阵分解得到的第一低秩矩阵和第二低秩矩阵;根据所述目标图像的评估值优化所述初始生成模型的模型参数,包括:根据第一梯度以及预设学习率将所述初始生成模型的模型参数由所述第一低秩矩阵调整为目标第一低秩矩阵;所述第一梯度是指所述评估值对所述第一低秩矩阵的梯度;根据第二梯度以及所述预设学习率将所述初始生成模型的模型参数由所述第二低秩矩阵调整为目标第二低秩矩阵;所述第二梯度是指所述评估值对所述第二低秩矩阵的梯度。
8.一种图像生成模型训练装置,其特征在于,所述装置包括:图像文本对定义模块,用于预定义多个图像文本对;每个图像文本对中的图像信息与文本信息相匹配;评估模型训练模块,用于基于所述多个图像文本对训练得到初始生成模型的评估模型;所述评估模型用于评估所述初始生成模型的输出图像的图像质量以及语义一致性;向量融合模块,用于对原始输入文本的三元组信息进行编码得到第一文本特征向量,对所述原始输入文本进行编码得到第二文本特征向量,以及将所述第一文本特征向量和所述第二文本特征向量进行融合得到融合文本特征向量;所述原始输入文本是指任一图像文本对中的文本信息;所述三元组信息包括主语文本信息、谓语文本信息和宾语文本信息;目标图像生成模块,用于将所述融合文本特征向量输入至所述初始生成模型中得到目标图像;所述初始生成模型用于对随机噪声图像进行多步图像处理得到所述目标图像;所述图像处理包括图像去噪以及图像评估;每一步的图像去噪是基于前一步的去噪图像以及所述融合文本特征向量进行的,每一步的图像评估是指通过所述评估模型对当前步的去噪图像的图像质量以及语义一致性进行评估得到评估值;所述目标图像的评估值大于预设评估阈值;模型优化模块,用于根据所述目标图像的评估值优化所述初始生成模型的模型参数,得到训练好的图像生成模型。
9.一种计算机设备,其特征在于,包括:存储器和处理器,所述存储器和所述处理器之间互相通信连接,所述存储器中存储有计算机指令,所述处理器通过执行所述计算机指令,从而执行权利要求1至7中任一项所述的图像生成模型训练方法。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机指令,所述计算机指令用于使计算机执行权利要求1至7中任一项所述的图像生成模型训练方法。




