有效
一种改进的三维文本分析系统
刘羽、郭晗、毕明艳、罗琴瑶、贺彪、蒯希、李胜、田沁
深圳市规划和自然资源数据管理中心(深圳市空间地理信息中心)
刘
刘羽 专利 2
深圳市规划和自然资源数据管理中心(深圳市空间地理信息中心)知识系统数据存储检索计算模型系统
郭
郭晗 专利 15
南方科技大学物理仪器计算技术碳碳键聚合
毕
毕明艳 专利 1
深圳市规划和自然资源数据管理中心(深圳市空间地理信息中心)知识系统自然语言处理数据存储检索
罗
罗琴瑶 专利 7
湖南师范大学物理仪器知识系统计算技术
贺
贺彪 专利 80
深圳市数字城市工程研究中心三维建模图像处理计算技术
蒯
蒯希 专利 34
深圳迈嘉城科信息科技有限公司计算技术图像处理物理仪器
李
李胜 专利 2
深圳市规划和自然资源数据管理中心(深圳市空间地理信息中心)生物模型计算计算模型系统计算技术
田
田沁 专利 8
深圳市规划和自然资源数据管理中心(深圳市空间地理信息中心)计算技术物理仪器计算模型系统
摘要
本发明属于铁路文本分析技术领域,本发明公开了一种改进的三维文本分析系统;文本采集模块,用于采集铁路报告事件文本;文本预处理模块,用于将铁路报告事件文本进行预处理,得到预事件文本;特征提取模块,用于根据预事件文本生成事件知识图谱;数据挖掘模块,用于将事件知识图谱进行深度挖掘分析,得到特征图级表示;风险判断模块,用于将特征图级表示输入至预先训练完成的风险判断模型;输出安全风险概率;预设安全风险阈值;若安全风险概率大于等于安全风险阈值,则发送安全警告至铁路维护端;更加精确地判断事件发生事故的概率,对铁路安全事件进行准确预警。
1.一种改进的三维文本分析系统,其特征在于,包括:文本采集模块,用于采集铁路报告事件文本;文本预处理模块,用于将铁路报告事件文本进行预处理,得到预事件文本;特征提取模块,用于根据预事件文本生成事件知识图谱;数据挖掘模块,用于将事件知识图谱进行深度挖掘分析,得到特征图级表示;风险判断模块,用于将特征图级表示输入至预先训练完成的风险判断模型;输出安全风险概率;预设安全风险阈值;若安全风险概率大于等于安全风险阈值,则发送安全警告至铁路维护端;各个模块之间通过有线和/或无线的方式进行连接,实现模块间的数据传输;所述将铁路报告事件文本进行预处理的方式包括:计算铁路报告事件文本中句子的语法复杂度,将语法复杂度高的句子进行拆分;得到拆分铁路报告事件文本;计算拆分铁路报告事件文本的句子语义相似度,合并句子语义相似度高的句子;得到合并铁路报告事件文本;定义句子有效性评分指标,根据句子有效性评分指标移除合并铁路报告事件文本中无意义句子;得到预事件文本;所述句子有效性评分指标包括模型指标和函数指标;模型指标的定义方式包括:构建句子有效性判别模型,句子有效性判别模型的输入为句子的词向量表示,输出为句子有效性概率;收集r组文本数据;并进行人工标注文本数据的有效性标签,有效性标签包括有效句子和无效句子;含有有效性标签的文本数据构成文本数据集;将文本数据集划分为训练集和验证集;将双向GRU网络框架作为句子有效性判别模型的基础框架,基础框架包括输入层、双向GRU层、全连接层和sigmoid输出层;双向GRU层为正向GRU层和反向GRU层;初始化双向GRU层和全连接层的权重参数;将训练集中的文本数据转换为词向量序列,并输入到句子有效性判别模型中;正向GRU层和反向GRU层分别捕捉词向量序列的隐层状态;将双向GRU层的隐层状态拼接得到句子语义表示向量;句子语义表示向量进入全连接层,进行非线性转换;最后Sigmoid输出层输出句子有效性概率;定义句子有效性判别模型的损失函数L; ;其中,y为文本数据的有效性标签; 为句子有效性判别模型输出的文本数据的有效性概率;W为句子有效性判别模型中的所有权重参数;N为训练集内文本数据的总数;i为文本数据的索引;h i 为第i个文本数据的句子表示向量;α和β为可调权重参数;利用误差反向传播算法更新双向GRU层和全连接层的权重参数;在训练集上迭代训练直到句子有效性判别模型的损失函数收敛;将验证集内的文本数据划分p个训练批次;按批次输入句子有效性判别模型,若损失函数在连续P次迭代的过程中不再下降;则得到训练完成的句子有效性判别模型;所述函数指标的定义方式包括:定义句子有效性评分函数F(s);F(s)=w1×Cd(s)+w2×St(s)+w3×Gj(s)+w4×Zw(s);式中,Cd(s)为句子s的句子长度;St(s)为句子s的命名实体数量;Gj(s)为句子s的关键词;Zw(s)为句子s的主谓宾完整性;w1、w2、w3和w4为评分权重系数;将合并铁路报告事件文本输出至句子有效性判别模型;获取f个预测的有效性概率;预设句子有效性概率阈值,若合并铁路报告事件文本中的句子的有效性概率小于句子有效性概率阈值,则判定句子为疑似无效;将判定为疑似无效的句子输入至句子有效性评分函数,得到对应的函数值;预设规则评分阈值,若判定为疑似无效的句子对应的函数值小于规则评分阈值,则判断该句子无效;即为无意义句子。
2.根据权利要求1所述的一种改进的三维文本分析系统,其特征在于,所述铁路报告事件文本包括异常信号文本报告、语音信息文本报告、图像视频文本报告和运输文本报告;通过在列车上安装物联网传感器实时监测铁路运输过程中的异常信号,并根据异常信号生成异常信号文本报告;通过在列车上设置语音识别装置,监听并识别铁路运输过程中人员的语音信息,并将语音信息转换为语音信息文本报告;对于铁路运输过程中拍摄的图片/视频通过图像识别算法进行内容分析,并生成文字描述,即为图像视频文本报告;将文本采集模块接入铁路信息系统,获取铁路信息系统记录的运输文本报告。
3.根据权利要求2所述的一种改进的三维文本分析系统,其特征在于,所述语法复杂度的计算方式包括:将铁路报告事件文本中的句子进行句法分析,得到句子的句法树结构;统计句法树结构的基础结构;基础结构包括树根、主干、分支、节点和树叶;收集n个句子,将句子进行人工标注出句子语法复杂度评分的标签;获取句子的句法树结构;计算句法树结构的基础结构;建立基础结构与人工标注的标签之间的回归模型,通过训练并调节回归模型的参数,使回归模型的预测输出等于标签;得到语法复杂度评分模型;所述回归模型的基础框架为GBDT模型或XGBoost模型;将铁路报告事件文本中的句子的句法树结构的基础结构输入至语法复杂度评分模型,输出语法复杂度评分;预设复杂度阈值,将大于或等于语法复杂度评分的句子作为复杂度高的句子;将语法复杂度高的句子进行拆分的方式包括:获取语法复杂度高的句子的句法树结构;标识句法树结构的主干和分支,在句法树的分支交汇处,将句子断开成两个子句。
4.根据权利要求3所述的一种改进的三维文本分析系统,其特征在于,所述句子语义相似度的计算方式包括:将拆分铁路报告事件文本中的句子转换为b个词向量;采用注意力机制,将词向量赋予权重,得到句子加权词向量;将句子加权词向量按照对应的词顺序进行串联或拼接得到句向量;计算句向量之间的余弦相似度,作为句子语义相似度;余弦相似度 其中,A·B表示句向量A和句向量B的点积求和;|A|和|B|分别表示句向量A和句向量B的L2范数;预设相似度阈值,将余弦相似度大于或等于相似度阈值对应的句向量对提取,作为句子语义相似度高的句子。
5.根据权利要求4所述的一种改进的三维文本分析系统,其特征在于,所述生成事件知识图谱的方式包括:将预事件文本输入至预先构建完成的基于BIO编码的命名实体识别模型,识别出预事件文本中的实体;识别出预事件文本中实体的主谓宾关系;根据主谓宾关系抽取预事件文本中的事件主体和事件动作;根据事件主体和事件动作构建实时三元组;将实时三元组构建成事件知识图谱;所述基于BIO编码的命名实体识别模型的构建方式包括:构建双层BiLSTM-CRF模型作为命名实体识别模型的基础框架;双层BiLSTM-CRF模型包括词特征表示层、首层Bi-LSTM层、第二层双向LSTM层和CRF解码输出层;词特征表示层将输入的预事件文本中的词进行词向量的转化;并引入词频词义记忆机制,通过词频矩阵调整词向量;生成词向量构成的序列;首层Bi-LSTM层学习词向量构成的序列的字级特征表示;输出单词语义向量;并引入词向量注意力机制,学习单词语义向量的重要性权重;并将重要性权重与词向量构成的序列拼接,得到加权词语表示序列;第二层双向LSTM层捕捉加权词语表示序列的上下语义,输出句子表示向量;CRF解码输出层将句子表示向量和预设的Y组命名实体BIO标注标签序列进行配对;运用配对函数计算句子表示向量和命名实体BIO标注标签序列的配对程度;获取Y个函数值,体现配对程度;将Y个函数值中最大的函数值对应的命名实体BIO标注标签序列作为识别结果进行输出;识别结果即为预事件文本中的实体。
6.根据权利要求5所述的一种改进的三维文本分析系统,其特征在于,所述特征图级表示的获取方式包括:构建基于图神经网络的事件知识图谱表示学习模型;事件知识图谱表示学习模型的输入为事件知识图谱,输出为事件知识图谱的特征图级表示;对于实体节点,利用预训练好的词向量作为实体节点初始的特征表示;对于关系节点,利用预训练好的词向量和人工特征组合作为关系节点初始的特征表示;定义消息函数,计算节点接收到的消息,并进行消息传递操作;所述消息函数m vu =σ(W 2 ·σ(W 1 [h v ,h u ]+b 1 )+b 2 );其中,m vu 表示从节点v到节点u传递的消息;h v 为节点v的特征表示;h u 为节点u的特征表示;W 1 和W 2 为权重矩阵,用于线性变换输入向量;b 1 和b 2 为偏置向量;[h v ,h u ]表示将节点v和u的特征表示拼接起来;σ为非线性激活函数;所述消息传递操作包括:每个节点v会向其邻居节点u发送消息;节点u接收来自所有邻居节点的消息,并进行聚合;得到聚合消息;进行聚合的方式为求平均或求和;节点u将接收到的聚合消息与节点u拼接,并通过一个更新函数更新自己的特征表示;所述更新函数 其中, 表示节点u更新后的特征表示;X u 为聚合消息;μ为注意力向量; 为点积符号;b 3 为更新函数的偏置向量;重复消息传递操作,得到稳定的节点特征表示;将所有节点表示拼接,获得事件知识图谱的特征表达;即特征图级表示。
7.根据权利要求6所述的一种改进的三维文本分析系统,其特征在于,所述风险判断模型的训练方式包括:构建风险判断模型的基础网络结构,风险判断模型的输入层用于输入特征图级表示,输出层用于输出安全风险概率;基础网络结构采用多层感知机、卷积神经网络和循环神经网络其中任一个;收集T组铁路安全事件数据,铁路安全事件数据包括文本描述、事件知识图谱和安全风险标注;将文本描述、事件知识图谱组合构建特征向量;将特征向量进行安全风险标注,并组成特征数据集;将特征数据集进行划分特征训练集和特征验证集;将特征训练集数据进行预训练,利用特征向量作为风险判断模型输入,安全风险标注作为标签,通过反向传播算法进行风险判断模型的参数学习,使模型对安全风险的判断误差不断减小,完成预训练过程;在特征验证集上测试模型的判断性能,若判断性能达到指定性能阈值,则保存训练好的风险判断模型;将新输入的特征图级表示输入预训练完成的风险判断模型,风险判断模型输出判断结果,即安全风险概率。



