1.一种面向大坝安全运行的事件图谱构建方法,其特征在于,包括如下步骤:(1)使用ALBERT嵌入层将包含大坝安全运行事件信息的句子和文档转化为特征向量,增强中文的语义信息,并使用BiLSTM处理每个词转换成的特征向量;(2)引入局部注意力模拟事件触发器,按重要性程度分配每个单词相应权值,取最高权重值单词为隐藏事件触发器,引入全局注意力学习句中关键词和文档语境信息,获得触发器在当前场景下唯一含义,辅助判断该句子的事件类型;(3)在模型训练过程中采用Focal loss作为损失函数,在解决样本不均衡问题的同时加强正样本和难分样本对模型的影响力,输出预测事件类型;(4)在特征向量后串联事件类型编码向量,组成新的句子编码,通过BiLSTM处理串联后的嵌入向量,捕获上下文信息;(5)根据依存句法分析生成的句子结构和BiLSTM生成的语义向量,引入注意力模式按权重融合图转换网络层和注意力网络层提取的特征,生成新的表示向量,通过BIO序列标注方式抽取事件论元;(6)采用TextCNN判断关键句中的关键事件,然后利用相邻句子中的填充词来补充缺失的事件角色实现事件的缺失论元提取,补充事件知识图谱;(7)加权融合图转换注意网络和注意力网络用以标注序列,获取事件之间的因果关系,构建事件图谱。
2.根据权利要求1所述的面向大坝安全运行的事件图谱构建方法,其特征在于,所述步骤(1)中使用ALBERT嵌入层将包含大坝安全运行事件信息的句子和文档转化为特征向量,增强中文的语义信息,并使用BiLSTM处理每个词转换成的特征向量的具体步骤如下:(1.1)以大坝日常工况与应急工况下的设备运行记录为微调训练语料库,之后在已经完成预训练的ALBERT模型上进行微调训练,将句子转换成数学形式的特征向量W;(1.2)使用BiLSTM网络处理句子特征向量W,输出两个隐藏状态 和 合成为 用LSTM输出向量h来表示句子上下文信息。
3.根据权利要求2所述的面向大坝安全运行的事件图谱构建方法,其特征在于,所述步骤(2)中引入局部注意力模拟事件触发器,按重要性程度分配每个单词相应权值,取最高权重值单词为隐藏事件触发器,引入全局注意力学习句中关键词和文档语境信息,获得触发器在该场景下唯一含义,辅助判断该句子的事件类型的具体步骤如下:(2.1)引入局部注意力机制,将LSTM输出向量h,事件类型特征向量t 1 作为输入,使用公式 获得局部注意力向量α s ,其中h k 是输出向量h中第k个部分, 是局部注意力向量α s 中第k个部分;(2.2)引入全局注意力机制,将输出向量h、事件类型嵌入向量t 2 和文档级嵌入向量d三部分作为输入,使用公式 计算全局注意力嵌入向量α d ,其中h k 是输出向量h中第k个部分, 是全局注意力向量α d 中第k个部分;(2.3)对α s 和t 1 使用点积操作,生成v s 捕获局部特征和模拟隐藏的事件触发器,对α d 和t 2 使用点积操作,生成v d 捕获全局特征和语境信息,之后使用Sigmoid函数o=σ(λ·v s +(1-λ)·v d )处理加权平均后的双重注意力向量v s 和v d ,λ∈[0,1]是在v s 和v d 之间进行权衡的超参数。
4.根据权利要求1所述的面向大坝安全运行的事件图谱构建方法,其特征在于,所述步骤(3)在模型训练过程中采用Focal loss作为损失函数,在解决样本不均衡问题的同时加强正样本和难分样本对模型的影响力,输出预测事件类型的具体步骤如下:(3.1)在模型训练过程中采用Focal loss作为损失函数J(θ),公式如下所示:其中,x是由句子和目标事件类型组成,y∈{0,1},o(x (i) )是模型预测值,||θ|| 2 是模型中各个元素的平方和,δ>0是L2归一化项的权重,β是平衡样本正负权重比例的参数,γ是平衡样本难分类和易分类权重比例的参数,在损失函数中增加L2正则化防止模型过拟合,之后训练模型;(3.2)使用训练完后的模型在大坝运行工况数据集上进行测试,根据提前设置好的可能事件类型,输出每个句子最有可能包含的事件类型数字。
5.根据权利要求4所述的面向大坝安全运行的事件图谱构建方法,其特征在于,所述步骤(4)在特征向量后串联事件类型编码向量,组成新的句子编码,通过BiLSTM处理串联后的嵌入向量,捕获上下文信息的具体步骤如下:在句子编码中加入(3)获得的句子预测事件类型,将其与词嵌入、实体类型嵌入和词性标注串联后组成312维向量作为嵌入向量,作为BiLSTM模型的输入,得到隐藏向量序列,作为本文语义结构。
6.根据权利要求1所述的面向大坝安全运行的事件图谱构建方法,其特征在于,所述步骤(5)根据依存句法分析生成的句子结构和BiLSTM生成的语义向量,引入注意力模式按权重融合图转换网络层和注意力网络层提取的特征,生成新的表示向量,通过BIO序列标注方式抽取事件论元的具体步骤如下:(5.1)使用一个N*N的依赖树邻接矩阵A d 作为句法结构,当单词w i 和w j 在依赖树中有链接,则A d (i,j)值设为1,否则为0;(5.2)如果w i 和w j 之间存在依赖边且依赖标签为r,使用嵌入查找表中r的嵌入向量初始化A dl (i,j),否则使用p维全零向量初始化A dl (i,j),之后使用公式 将依赖标签矩阵A dl 转化成依赖标签分数矩阵 其中U是可训练权重矩阵;(5.3)计算隐藏向量h i 和h j 之间分数获得语义分数矩阵A s ,计算公式如下:k i =U k h i ,q i =U q h i ,其中U k 和U q 是可训练权重矩阵;(5.4)将依赖树邻接矩阵A d 、依赖标签矩阵A dl 和语义分数矩阵A s 串联得到依赖关系图矩阵 (5.5)提出图转换注意网络GTANs,对依赖关系图矩阵A集合采用采用1×1卷积,选择其中两个中间邻接矩阵Q 1 和Q 2 ,通过矩阵相乘生成新的元路径图A l ,对元路径图A l 每个通道应用GAT网络,并将多个节点表示串联为Z,公式如下:其中,||是连接运算符,C表示通道数量, 是A l 的第i个通道的邻接矩阵, 是 的度矩阵,V是一个跨通道共享的可训练权重矩阵,X是一个特征矩阵;(5.6)引入注意力机制,计算注意力网络层权重矩阵 之后使用sigmoid函数激活加权融合图转换注意网络层和注意力网络层特征 (5.7)使用序列标注对事件进行标注,B标注关键论元的开始部分,I标注关键论元中间部分,O标注句中除关键论元外其他单词,之后使用条件随机场CRF处理特征融合向量 并输出每个字符在指定事件中的预测论元标签。
7.根据权利要求1所述的面向大坝安全运行的事件图谱构建方法,其特征在于,所述步骤(6)采用TextCNN判断关键句中的关键事件,然后利用相邻句子中的填充词来补充缺失的事件角色实现缺失论元提取,补充事件知识图谱的具体步骤如下:(6.1)对于事件遗漏的论元进行填充,串联论元标签、实体类型、句子和文档四种嵌入向量成880维新向量,设置大小为3,4,5的卷积核尺寸各128个处理输入的880维向量,投影至128维后经池化、全连接层判断句子是否包含关键事件;(6.2)对于包含关键事件的句子,使用MaLSTM模型计算同一文档中其余句子与该关键句的相似性并排序,寻找关键事件对应缺失论元且相似度最高的相邻句中的论元角色进行填充。
8.根据权利要求1所述的面向大坝安全运行的事件图谱构建方法,其特征在于,所述步骤(7)包含以下步骤:使用序列标注对事件进行标注,抽取原因与结果论元,将其所归属的事件定义为原因事件与结果事件,由此建立事件之间的因果关系,构建事件图谱。