有效
一种基于实体导向的多文档摘要生成系统及方法
丁兆云、赵雨、邹龍吟、王菲、辛乐海、刘凯、曹得琪、陈俊琪、汪佳乐
中国人民解放军国防科技大学
摘要
本发明提供了一种基于实体导向的多文档摘要生成系统及方法,涉及自然语言处理领域。第一编码器来有效分析模型跨文档实体信息、分析实体的显著性,结合层次自注意力机制构建第二编码器来分析跨文档关系,采用层次交叉注意力机制将实体、文段、文档以及Token层次的信息融入摘要生成中,实现能够分析出多文档构成的长文本中的显著实体,并改善摘要的事实忠实度和减少幻觉问题的技术效果。
1.一种基于实体导向的多文档摘要生成系统,其特征在于,包括:第一编码器、第二编码器以及解码器;所述第一编码器,用于在接收到多文档信息时,根据所述多文档信息生成目标跨文档信息;所述第二编码器,用于根据所述多文档信息结合层次自注意力机制输出时间步集合;所述解码器,用于接收所述目标跨文档信息和所述时间步集合并结合目标摘要,以层次交叉注意力机制生成推理摘要信息;所述解码器包含第一层交叉注意力机制和第二层交叉注意力机制;所述第一层交叉注意力机制用于根据所述时间步集合和目标摘要生成文档层次的信息交叉注意力;所述第二层交叉注意力机制用于处理文段和实体层次的信息;其中,所述第一编码器,还用于在接收到多文档信息时,根据所述多文档信息生成文段信息,同时采用实体聚类的方式在所述多文档信息中获取实体信息;对所述文段信息和所述实体信息进行图构建以生成图构建结果;引入图注意力网络更新所述图构建结果中的节点信息以生成目标跨文档信息;其中,所述第二编码器,还用于引入预训练语言模型,并采用Longformer来初始化注意力权重;在所述预训练语言模型中的多头自注意力的基础上构建层次注意力机制。
2.根据权利要求1所述的系统,其特征在于,所述第一编码器,还用于使用 来表示所述图构建结果中图的任意节点, 来表示任意两个节点上的节点表示,所述任意节点的维度为 ,使用 来表示节点 附近的节点集合;进行特征转换以生成特征表示 , ,其中 是权重矩阵;计算所述特征表示的注意力系数:其中 是经过训练得到的注意力机制向量,||表示连接操作, 为 矩阵 导出的边权值;对所述注意力系数进行归一化:使用归一化的注意力系数计算更新后的节点表示:其中 表示 函数, 是节点b的转换后特征, 是节点a和节点b之间的注意力系数;使用残差链接:每次迭代都包含一个段落到实体和一个实体到段落的更新过程,在迭代 次后,将更新后得到的文段表示 连接到相应的Token表示,得到 ,即 。
3.根据权利要求1所述的基于实体导向的多文档摘要生成系统,其特征在于,所述第二编码器,还用于对文档序列 ,定义对应的文档为 序列, ,其中 表示所述文档 中的某Token,数量为 ;对所述文档序列中第m个文档自注意力计算为: , , 其中 、 和 表示权重参数矩阵;通过所述层次注意力机制中每个自注意力层后面接一个残差链接后进行层归一化:其中 是自注意力前的输入, 是自注意力后的输出, ;对于前馈网络:进行残差连接后进行层归一化处理:所述第二编码器的输出表示 是所有时间步的 的集合: 。
4.根据权利要求1所述的基于实体导向的多文档摘要生成系统,其特征在于,所述第一层交叉注意力机制用于在给定 个文档,将所述解码器中针对每个单独文档的交叉注意力分数表示为:其中 表示第 个文档中的 ;计算每个文档中的 的交叉注意力权重:获取所述每个文档的层归一化缩放因子为:其中 表示第 个文档的注意力分数;计算得出所述每个文档中的 的标准化的注意力权重: 为文档层次的信息交叉注意力。
5.根据权利要求4所述的基于实体导向的多文档摘要生成系统,其特征在于,所述第二层交叉注意力机制还用于设定解码器的状态为 ,计算实体簇节点 上的注意力分数:其中 是所述注意力机制的权重向量, 用于转换解码器状态、 用于转换实体簇节点的嵌入,使用 激活函数, 表示向量矩阵的拼接;结合所述实体节点的注意力分数 和边的权重 ,以计算所述实体到段落节点的加权注意力分数 ;使用 进行归一化得到注意力权重 :根据注意力权重 从高到低选择前K个段落节点,然后将所述注意力机制应用到选择的段落节点对应的 个 :其中 是另一个注意力权重向量, 用于转换当前解码器状态 、 用于转换文段 的嵌入 ;使用 进行归一化得到注意力权重 : 。
6.根据权利要求5所述的基于实体导向的多文档摘要生成系统,其特征在于,所述解码器还用于将所述文段层面的注意力分数 和 层面的注意力分数相乘以得到每个文段中的 :计算解码步骤的上下文向量 :其中上下文向量 是一个加权和,其中每个 的贡献由 调整后的注意力分数确定;进行词汇分布的预测:获取目标摘要,在所述目标摘要中的每个 定义为 和时间步 的预测 ,使用 ;其中 表示在时间步 时,模型预测正确的 的概率, 表示目标序列的长度;对于整个训练批次,损失函数是单个样本损失的平均值:其中, 是批次中样本的数量, 是第 个样本的目标序列长度, 是第 个样本的模型预测概率分布, 是第 个样本在时间步 的实际目标词;x和y表示所述目标摘要, 为需要学习和训练的参数:对每个候选序列,计算 ,可以表示为 整个序列的累计分数,计算如下:根据所述累计分数以确定推理摘要信息。
7.一种基于实体导向的多文档摘要生成方法,其特征在于,所述基于实体导向的多文档摘要生成方法包括:第一编码器在接收到多文档信息时,根据所述多文档信息生成目标跨文档信息;第二编码器根据所述多文档信息结合层次自注意力机制输出时间步集合;解码器接收所述目标跨文档信息和所述时间步集合并结合目标摘要,以层次交叉注意力机制生成推理摘要信息;所述解码器包含第一层交叉注意力机制和第二层交叉注意力机制;所述第一层交叉注意力机制根据所述时间步集合和目标摘要生成文档层次的信息交叉注意力;所述第二层交叉注意力机制处理文段和实体层次的信息;其中,所述第一编码器在接收到多文档信息时,根据所述多文档信息生成文段信息,同时采用实体聚类的方式在所述多文档信息中获取实体信息;对所述文段信息和所述实体信息进行图构建以生成图构建结果;引入图注意力网络更新所述图构建结果中的节点信息以生成目标跨文档信息;其中,所述第二编码器引入预训练语言模型,并采用Longformer来初始化注意力权重;在所述预训练语言模型中的多头自注意力的基础上构建层次注意力机制。



