1.一种基于语法依存信息的文本事件抽取方法,其特征在于,步骤包括:S1.获取原始非结构化文本数据中各条待处理语句,并提取各条待处理语句的分布式表示向量;S2.获取各条待处理语句中各个单词之间的语法依存关系信息,构建得到各个单词之间的语法依存关系树;S3.根据各条待处理语句的所述分布式表示向量以及各个单词之间的所述语法依存关系树使用图神经网络进行迭代,提取得到各个单词的具有语法依存信息的特征向量;S4.使用步骤S3提取得到的特征向量进行事件抽取,得到事件抽取结果;所述步骤S3的具体步骤包括:S31.图构建:根据各个单词之间的所述语法依存关系树构建图G=(V,E),其中V为所述语法依存关系树中所有节点[v 1 ,v 2 ,…,v m ]的集合,每个节点为一个单词,各节点[v 1 ,v 2 ,…,v m ]与[w 1 ,w 2 ,…,w m ]按顺序一一对应,w 1 ~w m 分别为各条待处理语句中各个单词,m为单词数量,E为根据所述语法依存关系树中各个节点间的连接关系构建得到的集合,其中E内每条边e为所对应连接的两个节点之间的语法依存关系;S32.特征向量提取:以构建的所述图G为输入使用图神经网络进行迭代,其中基于所述分布式表示向量将各节点v i 初始化设置为对应的单词w i 的分布式表示o i ,i=1,2,…,m,经过迭代后得到各节点v i 在图神经网络中的特征向量,并作为对应各个单词w i 的所述具有语法依存信息的特征向量。
2.根据权利要求1所述的基于语法依存信息的文本事件抽取方法,其特征在于:所述步骤S1中使用预训练模型提取各条待处理语句的分布式表示向量。
3.根据权利要求2所述的基于语法依存信息的文本事件抽取方法,其特征在于:所述预训练模型具体为BERT模型,所述步骤S1中具体通过先获取所述BERT模型所需的预训练权重,再基于获取的所述预训练权重通过调用编码函数得到各条语句S=[w 1 ,w 2 ,…,w m ]的分布式表示O=[o 1 ,o 2 ,…,o m ],其中w 1 ~w m 分别为各条语句S中各个单词,o 1 ~o m 分别为输入语句S中对应各个单词的分布式表示。
4.根据权利要求1所述的基于语法依存信息的文本事件抽取方法,其特征在于,所述步骤S32中使用图神经网络进行迭代时,在所述图神经网络的第k层,节点v i 在所述图神经网络中的特征向量 为:其中,0<k<L,L为所述图神经网络的网络层数,N(w i )为节点w i 的邻接节点, 为边e(w i ,w j )的类型对应的权重, 为边e(w i ,w j )对应偏置系数;将单词w i 在L层的特征向量 作为单词w i 的所述具有语法依存信息的特征向量。
5.根据权利要求1或2或3所述的基于语法依存信息的文本事件抽取方法,其特征在于,所述步骤S4的步骤包括:S41.事件触发词分类:对步骤S3中提取得到的各个单词的所述具有语法依存信息的特征向量使用分类器进行分类,得到各个单词的触发词分类结果,识别出各个单词是否为事件触发词以及获取识别出的所述事件触发词对应的具体事件类型;S42.事件论元角色分类:将步骤S3提取出的特征向量中对应所述事件触发词的特征向量分别与原始文本数据的各个单词所对应的特征向量进行拼接,得到组合特征向量,对得到的各所述组合特征向量使用分类器进行分类,得到各单词的事件论元角色分类结果;S43.抽取结果输出:由识别出的所述事件触发词以及所述事件论元角色分类结果得到最终的事件抽取结果。
6.根据权利要求5所述的基于语法依存信息的文本事件抽取方法,其特征在于:所述步骤S41中获取识别出的所述事件触发词对应的具体事件类型时,包括根据所述触发词分类结果,将识别出的所述事件触发词外的所有单词视为候选事件元素,并依次与所述事件触发词进行特征向量拼接,对拼接得到的特征向量使用分类器进行分类,得到候选事件的分类结果。
7.根据权利要求5所述的基于语法依存信息的文本事件抽取方法,其特征在于:所述步骤S42中,具体将所述步骤S41中识别出的事件触发词w T 对应的特征向量 与原始文本数据的各个单词w i 的特征向量 分别相拼接,形成组合特征向量 其中i=1,2,…,m,m为单词数量,使用一个多分类器对得到的组合特征向量H i 进行分类,得到单词w i 的论元角色分类结果[w A1 ,w A2 ,…,w Ar ],r为分类为事件论元角色的数目。
8.一种基于语法依存信息的文本事件抽取装置,其特征在于,包括:分布式表示模块,用于获取原始非结构化文本数据中各条待处理语句,并提取各条待处理语句的分布式表示向量;语法依存信息获取及树构建模块,用于获取各条待处理语句中各个单词之间的语法依存关系信息,构建得到各个单词之间的语法依存关系树;特征向量提取模块,用于根据各条待处理语句的所述分布式表示向量以及各个单词之间的所述语法依存关系树使用图神经网络进行迭代,提取得到各个单词的具有语法依存信息的特征向量;事件抽取模块,用于使用所述特征向量提取模块提取得到的特征向量进行事件抽取,得到事件抽取结果;所述事件抽取模块包括:图构建单元,用于根据各个单词之间的所述语法依存关系树构建图G=(V,E),其中V为所述语法依存关系树中所有节点[v 1 ,v 2 ,…,v m ]的集合,每个节点为一个单词,各节点[v 1 ,v 2 ,…,v m ]与[w 1 ,w 2 ,…,w m ]按顺序一一对应,w 1 ~w m 分别为各条待处理语句中各个单词,m为单词数量,E为根据所述语法依存关系树中各个节点间的连接关系构建得到的集合,其中E内每条边e为所对应连接的两个节点之间的语法依存关系;特征向量提取单元,用于以构建的所述图G为输入使用图神经网络进行迭代,其中基于所述分布式表示向量将各节点v i 初始化设置为对应的单词w i 的分布式表示o i ,i=1,2,…,m,经过迭代后得到各节点v i 在图神经网络中的特征向量,并作为对应各个单词w i 的所述具有语法依存信息的特征向量。
9.一种存储有计算机程序的计算机可读存储介质,所述计算机程序执行时实现如权利要求1~7中任意一项所述基于语法依存信息的文本事件抽取方法。