在审

基于自适应交叉注意力融合的文本到图像生成方法及生成系统

田植良、赵潇然、赖宇、刘亚辉、吴天昊、何泽江、黄震、李东升
中国人民解放军国防科技大学

摘要

本申请属于跨模态生成技术领域,尤其涉及一种基于自适应交叉注意力融合的文本到图像生成方法及生成系统。该方法包括:获取条件输入信息,条件输入信息用于指示生成目标图像的文本描述信息、物体布局信息及文本视觉信息;基于条件输入信息,生成文本描述潜变量和图像视觉潜变量;基于图像视觉潜变量,确定文本视觉特征张量和初始图像特征张量;基于文本描述潜变量、图像视觉潜变量、文本视觉特征张量及初始图像特征张量,确定目标特征张量;基于目标特征张量,生成目标图像。本申请提供的技术方案,将文本生成与物体布局控制进行协同处理,确保了生成的目标图像中物体与文本描述之间的一致性,提高了目标图像的生成效果及生成效率。

暂无引用专利