1.一种基于多层次视觉引导的多模态对话摘要方法,其特征在于,在模型训练阶段执行如下步骤:将输入的多模态对话数据中的对话文本和目标摘要,利用T5模型的编码器,提取多模态对话的文本特征和摘要文本特征;以及,将输入的多模态对话数据的图像,利用CLIP模型的视觉编码器,以获得全局视觉特征和局部视觉特征,并构建文本特征与视觉特征的索引;将文本特征与局部视觉特征输入局部多模态注意力交叉模块,以及,将文本特征输入长短期记忆网络,以获得包含全局语义信息的隐藏态;在所述局部多模态注意力交叉模块,基于条件自注意力机制计算自注意权重,将包含全局语义信息的隐藏态与局部视觉特征计算局部视觉特征的条件权重,通过所述条件权重、自注意权重局部视觉特征进行加权,经过Transformer编码器,以获得语义引导的局部视觉特征;将文本特征与全局视觉特征输入全局多模态注意力交叉模块,文本特征输入长短期记忆网络中,获取捕获上下文信息的文本特征;全局视觉特征输入长短期记忆网络中,获取捕获全局信息的视觉特征;在全局多模态注意力交叉模块,使用跨模态多头注意力机制和跨模态双线性注意力融合机制,将两种机制所获得的结合视觉信息的文本特征进行加权和,经过Transformer编码器,获得全局视觉引导的文本特征;将语义引导的局部视觉特征和全局视觉引导的文本特征输入到模态融合模块,通过跨模态注意力机制,使用语义引导的局部视觉特征引导全局视觉引导的文本特征,以获得视觉信息引导的文本特征;使用全局视觉引导的文本特征引导语义引导的局部视觉特征,获得文本信息引导的视觉特征;并将视觉信息引导的文本特征与文本信息引导的视觉特征拼接,以获得双向增强的视觉-文本特征;将双向增强的视觉-文本特征和摘要文本特征输入到Transformer解码器,解码得到的文本特征经过线性层将高维向量的维度转换为可被词汇表映射的向量维度,将得到的向量输入到Softmax层,并使用束搜索方法,转换为概率分布;在训练过程中,计算模型预测的概率分布与目标摘要文本之间的交叉熵损失。
2.如权利要求1所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,利用T5模型的编码器,提取多模态对话的文本特征和摘要文本特征满足:T i =T5(t i )S i =T5(s i )其中,t i 为第i个对话输入,s i 为第i个对话的目标摘要,T5是T5模型,T i 为对话输入t i 的嵌入向量,S i 为摘要文本s i 的嵌入向量。
3.如权利要求1所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,利用CLIP模型的视觉编码器,以获得全局视觉特征和局部视觉特征满足:V fi =CLIP vis (V i )V fi ={V a ,V 1 ,…,V P }其中,V fi 为使用CLIP模型视觉编码器CLIP vis 获取的视觉特征, D v 为视觉特征维度,V a 为图像的全局视觉特征,V i 为图像的局部视觉特征。
4.如权利要求1所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,在所述局部多模态注意力交叉模块,基于条件自注意力机制计算自注意权重,将包含全局语义信息的隐藏态与局部视觉特征计算局部视觉特征的条件权重包括:在所述局部多模态注意力交叉模块,基于条件自注意力机制,通过映射矩阵获取局部视觉特征的查询Q、键K和值V;使用查询Q、键K和值V计算自注意权重;将包含全局语义信息的隐藏态与局部视觉特征计算局部视觉特征的条件权重。
5.如权利要求4所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,将文本特征输入长短期记忆网络满足:其中, 为时间步t的隐藏状态, 为时间步t的细胞状态,最后一步的隐藏态为 输出为T s 。
6.如权利要求5所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,在所述局部多模态注意力交叉模块,基于条件自注意力机制计算自注意权重,将包含全局语义信息的隐藏态与局部视觉特征计算局部视觉特征的条件权重包括:其中,W∈R d×d 为权重矩阵,α i,j 为自注意权重,β i 为条件权重,V i ′ 经过Transformer编码器获得语义引导的局部视觉特征X v 。
7.如权利要求6所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,全局视觉特征输入长短期记忆网络中,获取捕获全局信息的视觉特征包括:其中, 为时间步t的隐藏状态, 为时间步t的细胞状态,输出为V s 。
8.如权利要求7所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,在全局多模态注意力交叉模块,使用跨模态多头注意力机制和跨模态双线性注意力融合机制,将两种机制所获得的结合视觉信息的文本特征进行加权和,经过Transformer编码器,获得全局视觉引导的文本特征包括:A=V s BT sA ′ =softmax(A)T 2 =A ′ T sT=αT 1 +(1-α)T 2其中,CMA表示跨模态多头注意力,W是权重矩阵,B是双线性权重矩阵,α是可训练的权重,经过Transformer编码器层所获得的输出为X t 。
9.如权利要求8所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,通过跨模态注意力机制,使用语义引导的局部视觉特征引导全局视觉引导的文本特征,以获得视觉信息引导的文本特征;使用全局视觉引导的文本特征引导语义引导的局部视觉特征,获得文本信息引导的视觉特征;并将视觉信息引导的文本特征与文本信息引导的视觉特征拼接,以获得双向增强的视觉-文本特征包括:O enc =concat(T ′ ,V ′ )其中,T ′ 为视觉信息引导的文本特征,V ′ 为文本信息引导的视觉特征,concat为拼接操作,O enc 为双向增强的视觉-文本特征。
10.如权利要求8所述的基于多层次视觉引导的多模态对话摘要方法,其特征在于,在训练过程中,计算模型预测的概率分布与目标摘要文本之间的交叉熵损失包括:在训练过程中,计算模型预测的概率分布与目标摘要文本之间的交叉熵损失;将所有时间步的交叉熵损失进行平均,作为整体的平均损失,计算得到的平均损失进行反向传播,使用梯度下降法更新模型参数,最小化损失;计算模型预测的概率分布与目标摘要文本之间的交叉熵损失满足:其中,y i 是目标摘要文本的真实分布,p i 是模型预测的概率分布,θ是模型参数。