有效
基于知识图谱的文本内容摘要生成方法
孙国梓、唐翔宇、李华康、龚乐君、陈学业、聂可
南京邮电大学
摘要
基于知识图谱的文本内容摘要生成方法,通过知识图谱技术,对篇幅较长的文本内容进行知识结点抽取和逻辑结构分析,采用图语义摘要技术,生成内容更加凝聚的文本内容摘要。该方法不仅可以用于单篇文章的内容生成,通过结合分类融合技术,还能实现多篇文章的内容摘要生成,可以实现针对某个自然资源的多方面内容的自动摘要整理工作。
1.基于知识图谱的文本内容摘要生成方法,其特征在于:所述方法包括如下步骤:步骤1,对于输入的文本进行预处理工作,进行分句得到句子集合,并设定摘要输出格式;步骤2,利用知识图谱网络,基于实体概念集以及概念相似度,对文本进行实体增强;所述步骤2包括以下过程:针对集合L s 中的句子l g ,利用命名实体识别工具ltp,得到句子l g 的实体集合E={e 1 ,e 2 ,...e m };利用知识图谱网络,对原文S进行实体增强,得到实体增强集D Inc ,具体流程如下:在包含实体和实体概念的开发领域知识图谱G中,若实体e i ∈G,则根据图谱得到实体的概念集 利用文本相似函数Sim计算l g 与概念集中每个概念的相似度,其中文本相似度的计算方式如下:其中,句子l g 的向量表示为l g ={x 1 ,x 2 ,...,x n },d i 的向量表示为d i ={y 1 ,y 2 ,...,y n },文本的向量表示通过BERT预训练模型中提取;然后,选取与l g 最匹配的实体e i 的一条概念 设置概念候选阈值k,若 时,将概念 加入实体增强集中;重复以上步骤,遍历完实体集合E,得到句子l g 的实体增强集D Inc ;步骤3,对于得到的句子集合,利用BERT预训练模型,初始化文本序列向量;步骤4,利用编码器对文本语句和实体增强语句进行编码,通过解码器将二者拼接,生成摘要;所述步骤4包括以下过程:在原文编码器Encoder中,以原文文本序列向量表征X作为输入,利用LSTM模型计算在t1时间步的隐藏层状态h t1 ,1≤t1≤M,其中h t1 =LSTM enc (x t1 ,h t1-1 ),x t1 为t1时间步的输入,h t1-1 为上一时间步的隐藏状态;对于长度为M的序列输入,总共经过M个时间步,计算得到原文隐藏状态序列H={h 1 ,h 2 ,...h M };实体编码器与原文编码器的模型架构相同,以实体文本序列向量表征Z作为输入,计算在t2时间步的隐藏状态h′ t2 =LSTM enc (x t2 ,h′ t2-1 ),1≤t2≤K,并经过N个时间步,得到实体部分隐藏状态序列H′={h′ 1 ,h′ 2 ,...h′ N };在解码器Decoder中,利用得到的H和H′的最后一个时间步的隐藏状态序列,来初始化解码器的初始状态s 0 =ReLU(W f ·[h M ,h′ N ]),其中ReLU(x)=max(0,x),W f 为学习参数;在解码器Decoder中,利用LSTM模型计算t时间步的隐藏状态s t =LSTM dec (y t-1 ,[s t-1 ,c t-1 ,c′ t-1 ]),0≤t≤N,其中s t-1 为上一个时间步的隐藏状态输出,y t-1 为上一时间步的解码器输入,c t-1 ,c′ t-1 为上一时间步的原文信息和实体信息的上下文向量;对于当前时间步t利用原文信息和实体信息来计算解码器的attention分布,计算方式如下:a t =softmax(u t )a′ t =softmax(u′ t )其中a t ,a′ t 为时间步t下,原文信息和实体信息的attention分布,u t 为时间步t下原文信息隐藏层的attention信息,其中 为第i个时间步的attention信息,h i 是原文第i个时间步的隐藏状态;u′ t 为时间步t下实体信息隐藏层的attention信息,其中 为第j个时间步的attention信息,h′ j 是实体第j个时间步的隐藏状态;W h ,W s ,W′ h ,W′ s ,v T ,v′ T ,b attn ,b′ attn 为学习参数;利用在时间步t的原文信息和和实体信息的attention分布,计算当前时间步的上下文向量 其中a ti 表示原文第i个时间的attention表示,a′ tj 表示实体第j个时间步的attention表示;在解码时,利用参数λ控制原文信息和实体信息的比例,得到词汇表中单词的概率矩阵P(w):其中当前时间步的 其中 为模型学习参数,σ为sigmoid函数;模型训练的损失函数为 为当前时间步的真实字符,并利用反向传播算法更新学习参数,即函数x′=BP(x),x是学习参数;至此获取t时刻输出概率最高的n个单词,通过beam-search算法,将这n个单词分别与前t-1时刻的单词进行组合,生成t时刻的候选摘要集,其中beam-search算法规定beamsize的大小为k;第一个时间步长,选取当前条件概率最大的k个词,当做候选输出序列的第一个词;之后的每个时间步长,基于上个步长的输出序列,挑选出所有组合中条件概率最大的k个,作为该时间步长下的候选输出序列;始终保持k个候选;最后从k个候选中挑出最优的;重复以上过程,直至输出单词为A end 标识符或生成摘要长度为K,得到最终摘要。
2.根据权利要求1所述的基于知识图谱的文本内容摘要生成方法,其特征在于:所述步骤1包括以下过程:输入原文S,参考摘要A,利用分句工具jieba对S进行分句,得到句子集合L s ,并对摘要A进行分字操作,得到摘要A的Token组合,并在开头和结尾分别添加开始标识符A start 和结尾标识符A end ,并控制摘要A的长度为K个字符。
3.根据权利要求1所述的基于知识图谱的文本内容摘要生成方法,其特征在于:所述步骤3包括以下过程:对于句子集合L s 中的句子l g ,以单个汉字切分为长度M的Token集合V g ={v 1 ,v 2 ,...v M },并利用Bert中文预训练模型提供的通用词表将V g 中的单字转换为词表中的ID,利用转换函数BertID得到原文文本序列P={p 1 ,p 2 ,...p M },其中P=BertID(V g );对于摘要A中的Token集合利用BertID函数,得到长度K为的摘要文本序列Q={q 1 ,q 2 ,...q K };对于实体增强集D Inc 中的Token集合利用BertID函数,得到长度为N的实体文本序列R={r 1 ,r 2 ,...r N };对于原文文本序列P,摘要文本序列Q,实体文本序列R,通过Bert中文预训练模型BertEmb函数,得到编码器和解码器的Embedding向量表征,其中BERTEmb函数为Transformer架构中的Encoder部分,包括N层编码器计算单元堆叠而成,每层中包含Mutil-Head Attention、Layer Normalization、Feed Forward,通过上述结构计算得到原文文本序列向量表征X={x 1 ,x 2 ,...x M },摘要文本序列向量表征Y={y 1 ,y 2 ,...y K },实体文本序列向量表征Z={z 1 ,z 2 ,...z N }。



