1.一种基于开源数据事件抽取的目标跟踪方法,其特征在于,包括以下步骤:使用基于标签注意力机制的事件检测模型从预设的事件类型中检测出与情报语义相吻合的事件类型;用基于机器阅读理解的论元抽取方法提取目标名称及相关事件要素;整合目标名称、事件类型和事件要素得到结构化的事件对象<S,t,L,e,A,I>,其中S是故事,为拥有相同主题的一系列事件的集合,t表示事件的发生时间,L表示事件的发生地点集合,e表示事件,A表示事件的其它核心要素集合,I表示描述事件的情报文本集合;使用实体对齐方法将目标实体与实体库中的实体进行对齐,将目标分布映射到低维空间;按目标和时间组合事件,并扫描各个事件组,根据地点是否相似判别事件的等价性,进而合并等价事件使事件具有唯一性;针对事件唯一的事件组,依据不可能事件的定义依次判别两两事件的组合是否构成不可能事件,即冲突事件,通过度量事件可信度剔除冲突事件中不可信的事件;依据事件的隐式语义信息聚合相同主题的事件为簇,从而将事件分到不同故事,并基于故事特征提取摘要形成故事主题,便于用户了解整体故事内容;按目标对故事进行拆分,得到故事子集形成目标相关的故事情节,基于故事情节特征提取摘要形成故事情节主题,用于概括情节整体内容;以故事和故事情节为单位梳理时间脉络生成事件线,追踪主题事件的演化过程,并通过绘制故事情节事件线可视化目标跟踪过程。
2.根据权利要求1所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,所述使用基于标签注意力机制的事件检测模型从预设的事件类型中检测出与情报语义相吻合的事件类型,包括:对情报数据进行抽样统计分析,定义事件类型标签集合{y 1 ,y 2 ,…},其中y 1 ,y 2 分别表示第1个和第2个事件类型标签;对于情报文本数据集X={x 1 ,x 2 ,…,x n }进行事件类型标注,得到标签集Y={y 1 ,y 2 ,…,y n },x 1 ,x 2 ,x n 分别表示第1个、第2个和第n个情报文本,y 1 ,y 2 ,y n 分别表示第1个、第2个和第n个事件类型标签;将情报文本x i 表示为字的排列,并在首尾加上特殊标识符,得到输入x i =[[CLS],w 1 ,w 2 ,…,w m-1 ,w m ,[SEP]],其中w 1 ,w 2 ,…,w m-1 ,w m 分别表示第1、第2、第m-1,第m个字的排列;将情报的事件类型标签y i 转为one-hot编码;构造EDLA模型ELDA(x,W,b),输入所述情报文本数据集X和所述标签集Y作为训练集(X,Y),进行迭代训练,调整(W,b),使损失函数 最小化,得到更新后的模型参数W,b,其中y i 是真实值,y i 是估计值,n为样本个数;所述EDLA模型包含输入层、预训练语言模型层、句子向量表示层、标签注意力层以及输出层;给定情报文本x,输出预测的事件类型y=ELDA(x,W,b)。
3.根据权利要求1所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,所述用基于机器阅读理解的论元抽取方法提取目标名称及相关事件要素,包括:根据schema定义的事件元素类型构造问句,即将事件类型和事件元素类型通过一个特殊标识符“[AND]”连接;将文本添加无答案的两个标识符“[START]”、“[END]”;构造输入数据:将问句与文本拼接,并添加开头“[CLS]”和结尾标识符“[SEP]”;将构造好的输入数据输入到BERT模型进行编码;选择事件元素类型对应的编码输出使用注意力机制进行加权求和之后与到文本对应的编码输出进行合并;将合并后的数据输入到BiLSTM模型,获取文本的方向信息;在BiLSTM模型输出端分别连接一层全连接层并使用sigmoid函数激活之后得到答案的开始位置序列和结束位置序列;根据开始位置序列和结束位置序列按照就近原则从文本中抽取答案;根据无答案标识符“[START]”、“[END]”过滤掉无答案的输入数据,筛选出含有答案的输入数据;根据输入数据中问句含有的事件元素类型信息以及从文本中抽取的答案整理得到一段文本的事件元素类型信息、事件元素信息。
4.根据权利要求1所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,所述整合目标名称、事件类型和事件要素得到结构化的事件对象包括:基于文本特征降维算法对实体库R中的实体数据进行降维处理;使用实体召回算法获得粗粒度水平的候选对齐实体;针对候选实体,使用实体得分判定算法计算其与实体r的相似度得分,返回大于阈值的实体并组装为集合返回。
5.根据权利要求1所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,使用实体对齐方法将目标实体与实体库中的实体进行对齐包括:对实体库中的实体进行噪声剔除、数字归一化、机型归一化操作,将实体特征映射到更低维度空间,去除冗余特征;基于规则快速召回候选实体,减小整个实体对齐算法的复杂度;基于显示特征评估目标实体与备选实体的相似度,加权得到候选实体得分,输出得分高于阈值的候选实体作为对齐的对象;其中,所述基于规则快速召回候选实体的步骤如下所示:将实体库所有实体进行文本特征降维,获取实体库;输入实体,对输入实体进行文本特征降维操作;如果实体库中实体与输入实体相同直接输出实体库实体;如果实体库中实体与输入实体不同,进行如下处理:如果输入实体长度大于7,剔除输入实体后三个字和清洗后实体进行对比,当二者至少有两个字相同时,使用首字拼音匹配或前两个字拼音字母匹配,输出该实体库实体;如果输入实体长度在[5,7],剔除输入实体后两个字和清洗后实体进行对比,当二者至少有两个字相同时,使用首字拼音匹配或前两个字拼音字母匹配,输出该实体库实体;如果输入实体长度在[3,5],输入实体和清洗后实体进行对比,当二者至少有两个字相同时,使用首字拼音匹配或前两个字拼音字母匹配,输出该实体库实体;如果输入实体长度在[0,3],输入实体和清洗后实体进行全匹配,若输入实体所有字符全部在实体库中实体中,输出该实体;完成实体库初步筛选并对实体库和输入实体剔除后缀处理;输出结果;所述基于显示特征评估目标实体与备选实体的相似度,加权得到候选实体得分,输出得分较高或高于阈值的候选实体作为对齐的对象,包括:对实体匹配实体库进行判断:若实体库为空,反馈{“null_enity”:0};若匹配实体不为空:计算最终得分:s i =0.3*LCSS c (r,r i )+0.3*LCSS w (r,r i )+0.4*LCSS win (r,r i ,3),其中LCSS c (r,r i )为字数重合度,LCSS w (r,r i )为分词匹配度,LCSS win (r,r i ,3)为滑窗匹配度,其中r为实体,r i 为第i个候选实体;选取高于阈值的实体,输出最终的实体。
6.根据权利要求5所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,所述字数重合度LCSS c (r,r i ),计算如下:其中||表示集合的大小,C i 为实体r i 的字符集合,C为实体r的字符集合;所述分词匹配度LCSS w (r,r i )计算如下:其中W为对实体r进行分词得到的词集,W i 为对实体r i 进行分词得到的词集;LCSS win (r,r i ,3)为滑动窗口大小为3时的滑窗匹配度,计算如下:字符串集A通过使用大小为3的滑动窗滑过实体r中的字符串得到,字符串集A i 通过使用大小为3滑动窗口滑过实体r i 中的字符串得到。
7.根据权利要求1所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,所述按目标和时间组合事件,并扫描各个事件组,根据地点是否相似判别事件的等价性,进而合并等价事件使事件具有唯一性,包括:使用等价事件关联算法使用Sim l (e i ,e j )评估事件地点间的相似度:若L i =L j ,则Sim l (e i ,e j )=1;若L i ,L j 存在相互包含关系,则Sim l (e i ,e j )=0.6;其余情况,Sim l (e i ,e j )=0,其中L i 和L j 分别表示第i个和第j个事件的发生地点集合,e i 和e j 分别表示第i个和第j个事件。
8.根据权利要求1所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,所述针对事件唯一的事件组,依据不可能事件的定义依次判别两两事件的组合是否构成不可能事件,包括:获得元素唯一的事件集合;结合事件的论元结构归纳出不可能事件;对每一种不可能事件设计规则检测出冲突事件;结合事件情报来源的权威性以及事件在社交媒体上的提及次数,评估事件的可信度,并剔除冲突事件中可信度较小的事件。
9.根据权利要求1所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,所述依据事件的隐式语义信息聚合相同主题的事件为簇,包括:在预聚类阶段,依据显示语义信息使用DBSCAN聚类方法对事件进行分组,并提取事件的隐式语义特征;在细聚类阶段,基于上一阶段提取的事件隐式语义特征使用LDA方法进一步将事件关联为故事;所述DBSCAN聚类方法包括:为事件集合E中每个事件e学习其情报文本的词向量表示w e ;基于词向量使用DBSCAN方法将事件聚到类成员 中,其中P 1 ,P 2 , 是第1个、第2个、第N s 个事件簇;定义DBSCAN的距离函数为:其中 和 分别表示第i个和第j个事件的词向量表示;所述LDA方法包括:使用DBSCAN聚类结果初始化LDA主题模型中故事的词分布,即将属于同一预簇的事件的词向量赋给同一故事;使用吉布斯采样推断LDA主题模型的参数、事件的故事向量;将事件赋给概率最高的故事。
10.根据权利要求1所述的基于开源数据事件抽取的目标跟踪方法,其特征在于,所述按目标对故事进行拆分,得到故事子集形成目标相关的故事情节,包括:将故事中所有事件的情报文本进行分句和整合得到故事情报句子集合,并学习每个句子的词向量表示V;以句子为节点构建无向带权图,其中边的权重为句子间的余弦相似度;使用TextRank算法计算句子的排名,并将排名最高的两个句子拼接作为故事摘要输出。