1.一种基于混合注意力网络的事件检测方法,其特征在于,所述方法包括:步骤1,构建混合注意力网络模型,包括多语言表示层、混合注意力层和分类层;步骤2,在所述的多语言表示层进行源文本的翻译以及多种语言的目标文本的获取,并且进行了文本的对齐,将多种语言的文本转化为句子序列的向量表示;步骤3,在所述的混合注意力层,同时对多种语言的文本并行进行上下文注意力的学习,通过多语言注意力机制进行跨源语言和多种目标语言的信息融合;步骤4,将事件检测任务形式化为一个多类型分类问题,在分类层进行事件类型的预测分类;所述步骤2中多语言表示层输入的文本是单词序列文本,处理过程包括以下步骤:使用Google Translate来处理每一条输入的源语言文本,获得多种语言的并行目标语言文本;利用对齐工具 Giza++ 2来进行多种语言文本的对齐;在进行句子表示时,将每个输入分词 转化为一个实值向量 ,这个向量包括以下三种特征表示的联结:1)词向量:词向量能够捕获文本中单词的语义信息,通常被用作各种任务的基本向量;2)实体类型向量:使用标注好的实体信息作为额外特征,随机初始化每个实体类型的向量并且在训练过程中不断更新,不同的语言共享实体向量表;3)位置向量:位置向量表示了上下文分词 和当前分词 之间的相对距离 ,它通过查找一个随机初始化的位置向量表获得;由此,输入的文本被转化为一个向量序列 ,其中,每一个向量都是上述三种特征向量的联结;采用双向门控循环单元分别用两个GRU层在前向和后向处理向量序列,前向GRU层的隐层向量 编码从 到 的序列;相似地,反向GRU层的隐层向量 编码从 到 的序列;然后前向隐层向量 和反向隐层向量 被联结以组成 的向量表示,即 ;最后,输入序列的双向门控循环单元表示将作为整个句子的表示向量,源语言文本的向量表示为 ,第 个目标语言文本的向量表示为 ,其中, 和 分别是文本的句长;所述步骤3中混合注意力层,顺序进行上下文注意力机制和多语言注意力机制来捕获多语言线索;所述的上下文注意力机制的目的是生成上下文向量,挖掘不同种语言的上下文提供的一致性信息,所述的上下文注意力机制会在每种语言上分别进行;给定源语言文本的表示 ,上下文注意力机制会计算一个上下文表示向量 ,用于表示源语言文本上下文的综合信息,即: (1) (2) , (3)其中, 是权重矩阵, 是偏置项, 是源语言候选触发词表示 和第 个分词的表示 之间的相关性分数, 是第 个分词关于候选触发词的注意力权重;对于并行的目标语言文本,找出源语言候选触发词在其中的对应分词,并且进行和源语言相似的步骤获得上下文表示 ,这个表示表达了第 个目标语言文本的综合信息;所述的多语言注意力机制用于捕获源语言和多种目标语言之间,以及目标语言与目标语言之间的互补线索,并且控制互补线索向源语言文本的信息传递以辅助源语言中事件的识别,给定源语言文本的上下文表示 和一个多种翻译过后的目标语言的表示集合 ,其中 是目标语言的数量,多语言注意力将会通过卷积和池化操作来计算一个多语言的表示 。
2.根据权利要求1所述的事件检测方法,其特征在于,在所述的多语言注意力机制中设计了一个带有卷积滤波器和最大池化层的CNN框架以集成来自于源语言和一系列目标语言文本的互补信息,使用不同宽度的多个卷积滤波器来捕获语义流,具体来说,采用宽度为2和3的多个卷积滤波器对源句和目标句序列中的二元和三元语法语义进行编码,将卷积滤波器的输出输入到一个最大池化层,最终获得了两个固定长度的输出 和 。
3.根据权利要求2所述的事件检测方法,其特征在于,在分类层进行事件类型的预测分类时,采用一个softmax分类器来识别候选触发词,并且使用 , , 和 的联结作为分类器的输入: (4)其中, 是权重矩阵, 是偏置项,给定表示各种事件类型预测概率的实值向量 ,候选触发词 属于事件类型 的概率为: (5)其中, 表示参数集合, 是向量 的第 个元素。
4.根据权利要求3所述的事件检测方法,其特征在于,所述的混合注意力网络模型训练时,将训练数据中的分词集合表示为 ,对应的真实的事件类型集合为 ,其中 表示所有分词的数量,最小化多类型交叉熵损失来训练混合注意力网络模型 : (6)其中, 是正则化参数。
5.根据权利要求4所述的事件检测方法,其特征在于,在训练时,使用随机梯度下降进行训练,并且添加了dropout层用于正则化,采用负采样来准备训练数据,将无类型事件与有类型事件的比例设置为200:1,通过从训练集中随机选择小批次来迭代训练过程直至收敛。
6.一种基于混合注意力网络的事件抽取装置,其特征在于,包括:处理器;以及,存储器,用于存储所述处理器的可执行指令;其中,所述处理器配置为经由执行权利要求1至5任一所述可执行指令来执行基于混合注意力网络的事件检测方法。