有效
基于差异性神经表示模型的事件触发词检测方法
赵翔、廖劲智、李欣奕、唐九阳、徐浩、谭真、肖卫东
中国人民解放军国防科技大学
摘要
本发明基于差异性神经表示模型的事件触发词检测方法,所述方法包括:构建差异性神经表示模型,包括编码模块、对比学习模块和混合边界模块,所述的编码模块用于将句子中的每个单词生成高维向量空间中的表示,所述的对比学习模块,用于加大触发词内部组成单词与外部其他单词之间表示的差距,所述的混合边界模块,用于引导模型更好地区分触发词边界上的单词;利用训练好的差异性神经表示模型,对每个单词预测是否属于某一个触发词的起始位置或者结束位置,然后通过组合预测的开始位置和结束位置输出所有可能的触发词。本发明提出的学习框架提高了区分触发词内部和外部单词的能力,在多触发词识别中显著优于其他方法。
1.基于差异性神经表示模型的事件触发词检测方法,其特征在于,所述方法包括:步骤1,构建差异性神经表示模型,包括编码模块、对比学习模块和混合边界模块,所述的编码模块用于将句子中的每个单词生成高维向量空间中的表示,所述的对比学习模块,用于加大触发词内部组成单词与外部其他单词之间表示的差距,所述的混合边界模块,用于引导模型更好地区分触发词边界上的单词;步骤2,在所述的编码模块中,通过使用预训练BERT模型将句子的每个单词嵌入到高维向量空间中的上下文词向量表示中,以便提供包含语义特征的输入,同时,结合预定义事件类型的外部知识,进一步丰富单词表示中包含的信息;步骤3,在所述的对比学习模块中,捕获有助于区别触发词单词和句子中其他单词的特征来改进单词表示,通过最大化来自原始句子的单词表示和来自相似含义的扩充句子的单词表示的一致性;步骤4,在所述的混合边界模块中,通过将触发词的边界词的表示与其相邻词的表示进行混合,即可得到混合表示,然后,设计标记方案来构造用于混合表示的标签,利用额外的伪标记数据来训练与基本分类器一起工作的新分类器,新分类器有助于基本分类器对触发词片段和事件类型的判定,由此,提高差异性神经表示模型捕获触发词片段边界特征的能力;步骤5,利用训练好的差异性神经表示模型,对每个单词预测是否属于某一个触发词的起始位置或者结束位置,然后通过组合预测的开始位置和结束位置输出所有可能的触发词。
2.根据权利要求1所述的基于差异性神经表示模型的事件触发词检测方法,其特征在于,在所述的编码模块中,基于BERT的语言表示模型被用作编码器,所述的BERT由12个相同的Transformer块的堆栈组成,每个块处理词嵌入、位置嵌入和段嵌入,在所有块依次计算出三种类型的嵌入之后,BERT输出它们的总和作为表示,同时,在编码模块中,利用预定义的触发词类型作为外部知识来增强BERT中的自注意机制,只使用上层事件类别作为外部知识,将所有上层事件类别与每个句子连接起来,具体形式如下:[CLS]sentence[SEP]UT 1 [SEP]…[SEP]UT n [SEP],其中,[CLS]表示BERT中起始位置标记,sentence表示输入的特定句子,[SEP]表示BERT中间隔符标记,UT是upper-type的缩写,表示事件的上层类型,n是数据集中的上层事件类别的数量。
3.根据权利要求2所述的基于差异性神经表示模型的事件触发词检测方法,其特征在于,所述的对比学习模块采用以下对比学习方法步骤:步骤201,随机选取句子除了触发单词以及停用词之外的单词;步骤202,通过NLTK的WordNet选择要替换的词的对应同义词对原单词进行替换,以生成句子;步骤203,将生成的句子发送到具有相同参数的编码模块,所得的触发词的单词表示被视为正样本;步骤204,对于每个单词表示E∈R d ,其中R表示维度为d的实数空间,通过激活函数,表示为:C=ReLU(f(E)) (1)其中,ReLU是非线性激活函数,f是全连网络以将E转化为特定维度的输出,获得进一步的单词表示;步骤204,进一步的单词表示用作损失函数的输入。
4.根据权利要求3所述的基于差异性神经表示模型的事件触发词检测方法,其特征在于,所述的混合边界模块中,给定一个句子和一个触发词,L表示触发词的开始位置的单词表示,R表示触发词的结束位置的单词表示,N l 表示该单词到该离触发词开始最近的单词表示,N r 表示该单词到该离触发词结束位置最近的单词表示,M l 表示开始位置的单词混合表示,M r 表示结束位置的单词混合表示;α∈(0,1)和β∈(0,1)是用于调整组合中两个分量的权重的参数;使用线性组合,有:M l =α·L+(1-α)·N l , (2)M r =β·R+(1-β)·N r , (3)对于M l 和M r 的混合表示,设计了两种标记方案来构造相应的标签,第一种尝试减轻识别触发词的要求,并为其构建软标签,用公式表示为:m l =α·1+(1-α)·0=α, (4)m r =β·1+(1-β)·0=β, (5)其中α和β分别来自等式(2)和(3),第二种标记目的是增强对触发词的要求,并为它们构造甚难标签,即,m l =m r =0,一旦将相邻单词的表示与触发词的表示融合在一起,就认为混合表示已损坏,并用0标记新的单词表示;所述的混合边界模块基于混合表示来预测每个单词的标签,具体地,将每个单词分为n个类,其中n是事件类型的数量,然后根据每种类型预测标签,对于每个句子,分别有两个相同的开始位置和结束位置分类器,每个单词的分类器的详细操作如下,其中 是从句子中识别出第i个单词并将其分类为触发词的开始位置对于所有事件类型的概率, 是从句子中识别出第i个单词并将其分类为触发词的结束位置对于所有事件类型的概率,sigmoid是非线性激活函数,E i 是第i个单词在句子中的单词表示,W l 和W r 是神经网络中的可训练权重,而b l 和b r 是偏差项。
5.根据权利要求3或4所述的基于差异性神经表示模型的事件触发词检测方法,其特征在于,在差异性神经表示模型训练的过程中的综合损失函数为:其中, 和 分别表示开始和结束位置对比学习模块计算所得的损失值, 和 分别表示开始和结束位置混合边界模块计算所得的损失值,而λ∈(0,1)是超参数,用于控制损失值的数量级;混合边界模块的损失值计算公式如下:其中, 表示混合边界学习过程产生的损失值,P m 和L m 分别是通过混合边界模块预测的单词和真实标签的概率,γ∈(0,1)是一个超参数,用于平衡两个部分的权重;其中, 损失遵循二进制交叉熵损失函数,计算公示为:其中, 表示经由二进制交叉熵损失函数计算得出的损失值,P表示句子中单词的预测概率,L表示真实标签的集合;T是事件类型的集合,S是选定的句子,|·|表示特定对象的数量,1≤k≤n,n为事件类型的数量;所述的对比学习模块的损失值计算公式如下:其中, 表示对比学习模块计算得出的损失值,exp表示自然数e为底的指数,log表示自然对数,Sim的相似度函数评估两个表示的相关性,C是由式(1)产生的输出;Ω是句子中的一组单词,而Θ是其中的触发词的集合,Ω\Θ表示单词集合中不包含触发词;C θ 表示激活后的触发词的表示,C ω 表示激活后的另一个词的表示,而C θ '表示激活后的由扩充语句生成的触发词θ的表示。
暂无引用专利



