1.一种基于生成对抗训练的嵌套命名实体识别方法,其特征在于,包括以下步骤:获取输入序列;为每个实体类型设计一个实体标记,所述实体标记蕴含了关于实体类型的先验信息;使用抽取器抽取出特定于某个实体标记的所有实体文段,组成实体文段候选集;通过评估器评估抽取出的所述实体文段候选集,并给所述实体文段候选集打分;所述抽取器和判别器通过生成对抗训练来迭代地进行训练,使得所述抽取器抽取出准确的所述实体文段候选集合;迭代训练后所述抽取器挑选出某一实体类型的所有实体文段;对每种实体类型都进行抽取-挑选,直到抽取出输入序列中的所有嵌套和非嵌套实体,并输出所有嵌套和非嵌套实体的片段和语义类别;所述使用抽取器抽取出特定于某个实体标记的所有实体文段,包括:输入序列表示;实体标记表示和候选实体文段抽取;所述候选实体文段抽取使用混合选择策略,所述混合选择策略首先预测每个词元是实体文段开始和结束索引的概率,然后用概率来生成实体文段候选集,计算候选集的表示;所述混合选择策略具体包括:给定序列和实体标记的表示向量,抽取器首先预测词元i是实体文段的开始索引和结束索引的概率:其中,W s 和W e 是要学习的参数,h i 是第i个词元的隐层状态向量,h k 是第k个词元的隐层状态向量,m是实体标记的表示;获得可能的开始索引或者结束索引:I s =(i|argmax(p s (i|y,S))=1,i=1,...,n}I e ={j|argmax(p e (j|y,S))=1,j=1,…,n}然后,对于每个给定的开始索引i s ∈I s 和结束索引j e ∈I e ,且i s ≤j e ,使用一个二元分类器来预测实体文段候选 的概率:其中W C 是要学习的参数, 是开始词元的隐层状态向量, 是结束词元的隐层状态向量;通过一个概率阈值来抽取实体文段候选,所有可能的实体文段候选构成了实体文段候选集合C;计算p c (i|y,S)作为第i个词元出现在候选集合C中的概率,以这种方式,用连续向量p c 来表示C。
2.根据权利要求1所述的基于生成对抗训练的嵌套命名实体识别方法,其特征在于,所述输入序列表示包括:将输入序列S的所有词元表示为嵌入序列,所述嵌入序列中的每个嵌入表示是字符向量、词向量、上下文词向量和词性向量的连接,所述字符向量是由词元表示输入到第一Bi-LSTM网络产生;所述上下文词向量通过为每个词元生成上下文依赖的上下文嵌入得到;所述字符向量、词向量、上下文词向量和词性向量的连接输入到第二Bi-LSTM网络中,以获取最终的词元表示。
3.根据权利要求1所述的基于生成对抗训练的嵌套命名实体识别方法,其特征在于,所述实体标记是实体类型的细粒度表示,每种实体类型对应一个实体标记,所述实体标记表示包括:使用实体类型的关键词与同义词的连接作为实体标记,所述关键词是描述实体类型的词,所述同义词指从牛津词典摘出的与所述关键词含义相同的词或者短语;连接关键词与同义词的词向量得到实体标记y * 的表示向量,然后把所述表示向量输入到第二Bi-LSTM网络,获得实体标记的最终表示:其中,h i 是隐层状态向量,编码了词元x i 的上下文信息;使用自注意力机制集成所述实体标记的最终表示:其中,α j 是u j 的注意力权重,W a 是可学习的参数,m是实体标记的最终表示。
4.根据权利要求1所述的基于生成对抗训练的嵌套命名实体识别方法,其特征在于,判别器的评估包括候选文段集合表示和候选集合打分:所述候选文段集合表示将实体类型y和序列S编码进实体文段候选集合的表示p c ,具体包括以下步骤:用Match-LSTM网络构建实体感知的序列表示:其中,h i 是隐层状态向量,编码了词元x i 的丰富的上下文信息, 是实体标记的最终表示,|y * |是实体标记的长度,|S|表示序列的长度;所述实体文段候选集合的表示r C 通过加权和用r i 和概率p C (i|y,S)计算:其中r C 是实体文段候选集合的表示,β i 是权重系数,r k 是序列S中第k个词元的表示,p C (i|y,S)是第i个词元出现在候选集合C中的概率,所述候选集合打分包括:抽取器抽取出来的实体文段候选集合的分数通过sigmoid函数计算:score=sigmoid(W b r C )其中,W b 是可学习的参数,所述分数用于在生成对抗训练过程中迭代地训练抽取器和判别器。
5.根据权利要求1所述的基于生成对抗训练的嵌套命名实体识别方法,其特征在于,所述所述抽取器和判别器通过生成对抗训练来迭代地进行训练包括包括三个任务,其中第一个任务是训练抽取器来正确预测实体文段的开始和结束索引;第二个任务是训练抽取器更好地进行开头-结尾索引的匹配;第三个任务是通过生成对抗训练联合训练抽取器和判别器,其中抽取器被视为生成器,并被训练以从判别器获得更高的分数;在迭代训练之后,使用抽取器选出实体文段的最终结果。
6.根据权利要求5所述的基于生成对抗训练的嵌套命名实体识别方法,其特征在于,所述第一个任务具体为最小化黄金实体文段真正的开始和结束索引的负对数概率,损失函数如下:l′ E =-logp s (s|y,S)-logp e (e|y,S)其中s和e表示序列S中黄金实体文段的开始和结束索引,p s (s|y,S)是黄金实体文段真正的开始索引的概率,p e (s|y,S)是黄金实体文段真正的结束索引的概率;所述第二个任务具体为最小化黄金实体文段真实的开头-结尾索引匹配的负对数概率,损失函数如下:l″ E =-logp s,e其中p s,e 是黄金实体文段真实的开头-结尾索引匹配的概率;所述第三个任务具体为训练抽取器从判别器获得更高的分数,损失函数如下:l″′ E =log(1-f D (y,S))其中f D (y,S)为所述抽取器抽取出来的实体文段候选集合的分数;抽取器的总体训练目标函数为:l E =γ 1 l′ E +γ 2 l″ E +(1-γ 1 -γ 2 )l″′ E其中γ 1 ,γ 2 ∈[0,1]是超参数,平衡各个部分对总体目标函数的贡献,所述三个损失函数通过端到端的方式联合训练;其中γ 1 ,γ 2 ∈[0,1]是超参数,平衡各个部分对总体目标函数的贡献,所述三个损失函数通过端到端的方式联合训练;所述使用抽取器选出实体文段的最终结果包括:在推理阶段,给定序列S和实体标记y * ,训练好的抽取器分别基于I s 和I e 选择出开始和结束索引;然后进行开始和结束索引的匹配,得到特定实体类别的实体文段。