1.一种铁路事故因子辨识与关系抽取方法,其特征在于,所述铁路事故因子辨识与关系抽取方法包括:历史事故文本数据集获取步骤:针对多种来源的铁路历史事故写实文档段落篇章布局特征,定义正则表达式,抽取所述历史事故写实文档中对事件描述的文本段落进行数据清洗,获取有效的历史事故文本数据集;结构化特征提取步骤:对所述有效的历史事故文本数据集基于预构造的铁路领域词表进行分句的分词后,基于所述分词进行词性标注及命名实体识别,将所述词性标注的结果进行依存句法结构生成后,进行所述历史事故文本数据集结构化特征提取和结构化存储;致因因子辨识分类步骤:标注所述历史事故文本数据的结构化特征进行知识库的构建,基于所述知识库通过构建包含多层致因因子的致因因子识别方法进行事故致因因子辨识,分类得到多层事故致因因子集;致因因子关系抽取步骤:基于所述多层事故致因因子集进行排序组合,构建形成事故致因因子链,实现事故致因因子关系的抽取。
2.根据权利要求1所述铁路事故因子辨识与关系抽取方法,其特征在于,所述历史事故文本数据集获取步骤进一步包括:文本格式转换步骤:针对包含多种格式及多个来源的铁路历史事故写实文档,采用统一文件编码方式进行文件类型转换,得到可识别格式的文件;有效文本获取步骤:分析所述可识别格式的文件的段落篇章布局特征,设计正则表达式,过滤清洗无关的铁路历史事故文本,获得由有效的铁路历史事故文本组成的铁路历史事故文本数据集。
3.根据权利要求1所述铁路事故因子辨识与关系抽取方法,其特征在于,所述结构化特征提取进一步包括:分词步骤:针对铁路历史事故文本,根据标点符号进行分句划分,得到分句集,所述铁路领域词表包括:铁路领域停用词表及铁路领域个性化分词表,采用预训练分词模型,结合铁路领域停用词表及铁路系统个性化分词表,针对所述分句集进行分词,得到分词结果;词性标注步骤:针对所述铁路历史事故文本分句的分词结果,采用预训练词性标注模型进行词性标注;命名实体识别步骤:针对所述铁路历史事故文本分句的分词结果,采用预训练命名实体识别模型进行命名实体识别;词性筛选步骤:基于所述词性标注步骤得到的词性标注结果,对所述铁路历史事故文本进行分词词性筛选,保留预设有效词类,将筛选结果拼接,形成对应于所述铁路历史事故文本的新文本及新语料;词频-逆向文件频率值计算步骤:针对所述新语料计算各个所述铁路历史事故文本中筛选后所述预设有效词类的词频-逆向文件频率TF-IDF值,计算得出词语在不同文档中的代表性评分;补充优化步骤:通过筛选各文档中所述代表性评分较高的词语,重复执行所述分词步骤至所述词频-逆向文件频率值计算步骤,对所述铁路领域停用词表及所述铁路领域个性化分词表进行补充优化;依存句法结构识别步骤:基于所述铁路历史事故文本分句的分词结果及词性标注结果作为特征输入,采用预训练依存句法分析模型进行依存句法结构识别,所述分句中可得到多种依存句法结构,形成多元组特征并进行结构化存储。
4.根据权利要求1所述铁路事故因子辨识与关系抽取方法,其特征在于,所述致因因子辨识分类步骤进一步包括:致因因子体系构建步骤:构建基于人机环管的多层致因因子体系,形成致因因子分类标签与描述的映射关系;知识库构建步骤:针对文本数据的结构化特征进行标注构建多层知识库,所述知识库包括:映射关系、关键词词表及依存结构表;致因因子集获取步骤:针对铁路历史事故文本数据集,完成数据清洗及文本特征计算后,基于所述知识库通过构建包含多层结构的致因因子识别进行事故致因因子分类辨识,生成致因因子备选集,通过对致因因子融合去重,得到了测试铁路历史事故文本数据集对应的致因因子集。
5.根据权利要求4所述铁路事故因子辨识与关系抽取方法,其特征在于,所述知识库构建步骤进一步包括:获取铁路历史事故文本中词性标注为预设标记的外语单词,所述外语单词在文本中对应铁路事故等级,基于所述外语单词在所述多层致因因子体系中进行标注,获得具体标签,并在所述知识库中构建所述映射关系;将所述铁路历史事故文本数据集词语对应的TF-IDF值从高到低排序,筛选预设有效词类中词性为动词、名词以及实体词语作为备选,由专家标注关键词,并在所述知识库中将关键词积累到标签类别对应的所述关键词词表中;针对所述铁路历史事故文本的所述依存句法结构中的主谓关系、动宾关系、状中结构,利用依存句法结构的代表性评分值从高到低排序,由专家标注关键依存结构,并在所述知识库中将关键依存结构积累到标签类别对应的依存结构表中。
6.根据权利要求4所述铁路事故因子辨识与关系抽取方法,其特征在于,所述致因因子集获取步骤进一步包括:将测试铁路历史事故文本中标记类型为预设标记的外语单词根据所述映射关系进行映射,得到第一层致因因子;采用所述关键词词表对测试铁路历史事故文本分词后的动词、名词结果进行检索,得到命中关键词序列,针对所述命中关键词序列中相邻出现的同一致因因子命中关键词进行过滤,得到过滤后的命中关键词序列为第二层致因因子;采用所述依存结构表对测试铁路历史事故文本的依存句法结构进行检索,得到命中依存句法结构序列,对相邻出现的同一致因因子命中结构进行过滤,得到过滤后的命中依存结构序列为第三层致因因子,所述致因因子备选集包括:第一层致因因子、第二层致因因子及第三层致因因子。
7.根据权利要求6所述铁路事故因子辨识与关系抽取方法,其特征在于,所述致因因子关系抽取步骤进一步包括:将关键词和依存句法结构的命中序列进行去重融合,融合过程结合铁路历史事故文本书写逻辑和所述人机环管的多层致因因子体系的内在关系,将属于预设类别因子排序提前,得到复合序列;基于所述复合序列,根据第一层致因因子的因子类别划分为:第一层致因因子对应的致因因子包含在所述复合序列中,则事故的致因因子关系为所述复合序列,得到致因因子关系链;第一层致因因子对应的致因因子属于人为类或管理类因子且不包含在所述复合序列中,则将所述致因因子组合在所述复合序列中,使其排序在管理类致因因子后的第一个位置,得到致因因子关系链;第一层致因因子对应的致因因子不属于人为类和管理类因子且不包含在所述复合序列中,则将其排序在所述复合序列最后一项,得到致因因子关系链。
8.一种铁路事故因子辨识与关系抽取系统,采用如权利要求1-7中任意一项所述铁路事故因子辨识与关系抽取方法,其特征在于,所述铁路事故因子辨识与关系抽取系统包括:历史事故文本数据集获取模块:针对多种来源的铁路历史事故写实文档的段落篇章布局特征,定义正则表达式,抽取所述历史事故写实文档中对事件描述的文本段落进行数据清洗,获取有效的历史事故文本数据集;结构化特征提取模块:对所述有效的历史事故文本数据集基于预构造的铁路领域词表进行分句的分词后,基于所述分词进行词性标注及命名实体识别,将所述词性标注的结果进行依存句法结构生成后,进行所述历史事故文本数据集结构化特征提取和结构化存储;致因因子辨识分类模块:标注所述历史事故文本数据的结构化特征进行知识库的构建,基于所述知识库通过构建包含多层致因因子的致因因子识别方法进行事故致因因子辨识,分类得到多层事故致因因子集;致因因子关系抽取模块:基于所述多层事故致因因子集进行排序组合,构建形成事故致因因子链,实现事故致因因子关系的抽取。
9.一种计算机设备,包括存储器、处理器以及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1至7中任一项所述铁路事故因子辨识与关系抽取方法。
10.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该程序被处理器执行时实现如权利要求1至7中任一项所述铁路事故因子辨识与关系抽取方法。