有效
一种基于区分性词向量表示的事件检测方法
唐九阳、廖劲智、赵翔、李欣奕、谭真、陈盈果、黄魁华
中国人民解放军国防科技大学
摘要
本发明一种基于区分性词向量表示的事件检测方法,所述方法包括:构建一种基于区分性词向量表示模型,包括编码模块、高斯核函数模块和对抗学习模块,所述的编码模块用于将句子中的每个单词生成高维向量空间中的表示,所述的高斯核函数模块,用于加大触发词内部组成单词与外部其他单词之间表示的区分性,所述的对抗学习模块,用于提升对触发词正样本的泛化识别能力;利用训练好的区分性词向量表示模型,在所有事件类型上逐一对每个单词预测是否属于该类下某一个触发词的起始位置或者结束位置,然后通过组合预测的开始位置和结束位置输出所有可能的触发词。
1.一种基于区分性词向量表示的事件检测方法,其特征在于,所述方法包括:步骤1,构建区分性词向量表示模型,包括编码模块、高斯核函数模块和对抗学习模块,所述的编码模块用于将句子中的每个单词生成高维向量空间中的表示,所述的高斯核函数模块,用于加大触发词内部组成单词与外部其他单词之间表示的差异性,所述的对抗学习模块,用于提升对触发词正样本的泛化识别能力;步骤2,在所述的编码模块中,通过使用预训练BERT模型将句子的每个单词嵌入到高维向量空间中的上下文词向量表示中,以便提供包含语义特征的输入,同时,结合预定义事件类型的外部知识,进一步丰富单词表示中包含的信息;步骤3,在所述的高斯核函数模块中,通过对编码后的词向量表示进行高斯核函数变换,利用高斯处理将词向量的分布约束在高斯分布中,以实现词向量在高维空间中的聚类,提升其对触发词和非触发词的差异性编码能力;步骤4,在所述的对抗学习模块中,在训练时通过向词向量中加入随机扰动,促使模型更多地关注训练样本中有规律的语义信息,进而提升模型触发词正样本的泛化能力;步骤5,利用训练好的区分性词向量表示模型,在所有事件类型上逐一对每个单词预测是否属于该类下某一个触发词的起始位置或者结束位置,然后通过组合预测的开始位置和结束位置输出所有可能的触发词;步骤6,根据触发词的预测结果进行文本中的事件检测。
2.根据权利要求1所述的一种基于区分性词向量表示的事件检测方法,其特征在于,在所述的编码模块中,基于BERT的语言表示模型被用作编码器,所述的BERT由12个相同的Transformer块的堆栈组成,每个块处理词嵌入、位置嵌入和段嵌入,在所有块依次计算出三种类型的嵌入之后,BERT输出它们的总和作为表示,同时,在编码模块中,利用预定义的触发词类型作为外部知识来增强BERT中的自注意机制,只使用上层事件类别作为外部知识,将所有上层事件类别与每个句子连接起来,具体形式如下:[CLS]sentence[SEP]UT 1 [SEP]…[SEP]UT m [SEP],其中,[CLS]表示BERT中起始位置标记,sentence表示输入的特定句子,[SEP]表示BERT中间隔符标记,UT是upper-type的缩写,表示事件的上层类型,m是数据集中的上层事件类别的数量。
3.根据权利要求2所述的一种基于区分性词向量表示的事件检测方法,其特征在于,所述的高斯核函数模块中:经过编码模块后,可获得每个单词表示E∈R l×d ,其中R表示维度为d的实数空间,l表示输入文本的序列长度,整个高斯核函数映射过程由平均词向量表示和核函数两个部分构成,即:p(X)=N(X|mean(E),K EE ) (1)X=f(E)其中,p表示先验概率即高斯概率分布,N表示高斯分布符号,mean表示求目标序列中的平均词向量表示,f表示全连接网络对词向量表示进行映射,K EE 表示核函数,具体定义如下:[K EE ] ij =k(E i ,E j )=exp(-γ||E i -E j || 2 ) (2)其中,k表示核函数运算,E i 和E j 分别表示文本中对应i和j位置的词向量,exp表示自然指数函数,γ表示超参数, 表示向量的范数;使用插值法抽在词向量中获取一定规模的数据样本,有:U={f(I 1 ),f(I 2 ),...,f(I k )} (3)其中,U表示插值后获得的词向量序列,I∈R d 表示不按序列顺序获取的词向量;当插值取值达到一定规模时,其概率分布同样符合高斯分布,此时有:p(U)=N(mean(I),K II ) (4)其中,K II 所表示核函数与K EE 相同。
4.根据权利要求3所述的一种基于区分性词向量表示的事件检测方法,其特征在于,所述的对抗学习模块中采用以下对抗学习方法步骤:步骤401,构造对抗学习中的随机扰动产生方式,表示为:其中,r adv 表示最终输入的随机扰动,r表示随机扰动, 表示二范数,ε表示超参数, 表示损失函数,θ表示模型中需要学习的参数;步骤402,采用线性近似生成上述随机扰动,表示为:r adv =-εg/||g|| (6)其中,g表示损失函数 对输入词向量表示E的梯度, 表示梯度运算,f表示模型运算,y表示样本标签;步骤403,在经过编码层的词向量表示E∈R d 上加入随机扰动,表示为:E+r adv步骤404,将随机扰动的词向量表示用作损失函数的输入。
5.根据权利要求3所述的一种基于区分性词向量表示的事件检测方法,其特征在于,在模型训练的过程中的综合损失函数为:其中, 表示高斯核函数模块计算所得的损失值, 和 分别表示开始和结束位置对抗学习模块计算所得的损失值,α∈(0,1)表示超参数用于控制损失值的数量级;高斯核函数模块的损失值计算如下:L G =E[-lnp(U|X)]+KL[q(U|X)||p(U)] (9)其中,E表示求期望,ln表示自然数为底的对数函数,KL表示相对熵,||为相对熵中的特殊标记符号,无实际含义,p(U|X)表示条件概率,计算如下:其中,[K IE ] ij =k(I i ,E j ),K -1 表示转置且 q(U|X)表示先验概率,q同样是满足高斯分布的后验概率,对q(U|X)的计算基于神经网络,具体如下:其中,μ和σ 2 表示神经网络的输出即q分布的均值和方差;对抗学习模块的损失值计算如下:其中, 表示事件抽取过程产生的损失值,P表示模型预测单词的概率,P adv 表示对抗学习模块预测单词的概率,L表示要预测单词的真实标签,γ∈(0,1)是一个超参数,用于平衡两个部分的权重;其中, 损失遵循二进制交叉熵损失函数,计算公示为:其中, 表示经由二进制交叉熵损失函数计算得出的损失值,P表示句子中单词的预测概率,L表示真实标签的集合;T是事件类型的集合,S是选定的句子,|·|表示特定对象的数量,1≤k≤n,n为事件类型的数量。
暂无引用专利



