有效
一种基于分层策略网络的事件抽取方法及设备
赵翔、黄培馨、谭真、胡升泽、肖卫东、胡艳丽、张军、李硕豪
中国人民解放军国防科技大学
赵
赵翔 专利 194
浙江大学知识系统自然语言处理数据存储检索
黄
黄培馨 专利 7
中国人民解放军国防科技大学自然语言处理电子数据处理计算技术
谭
谭真 专利 88
中国人民解放军国防科技大学自然语言处理知识系统数据存储检索
胡
胡升泽 专利 18
中国人民解放军国防科技大学电子数据处理计算模型系统计算技术
肖
肖卫东 专利 82
中国人民解放军国防科技大学自然语言处理数据存储检索计算模型系统
胡
胡艳丽 专利 36
中国人民解放军国防科技大学知识系统计算模型系统生物模型计算
张
张军 专利 102
中国人民解放军国防科技大学视觉识别图像视频识别生物模型计算
李
李硕豪 专利 64
中国人民解放军国防科技大学生物模型计算视觉识别计算模型系统
摘要
本发明公开了一种基于分层策略网络的事件抽取方法及设备,所述方法包括以下步骤:构建分层策略网络;在从句子头向句子尾扫描的过程中,事件级策略网络在每个分词处检测触发词并且对检测出来的触发词分类事件类型;一旦一个特定的事件被检测出来,论元级策略网络将被触发,开始从头到尾扫描句子,以检测当前这个事件的参与论元;一旦一个论元被识别出来,角色级策略网络将被触发,以预测当前事件下,这个论元在事件中扮演的角色;当角色预测完成,论元级策略网络会继续从当前论元的分词处往后扫描句子来检测事件的其他论元直到扫描到句子尾;之后事件级的策略网将继续从当前事件的分词处往后扫描句子来检测句子包含的其他事件直到扫描到句子尾。
1.一种基于分层策略网络的事件抽取方法,其特征在于,包括以下步骤:步骤1,构建分层策略网络,所述的分层策略网络包括事件级策略网络、论元级策略网络和角色级决策网络;步骤2,在从句子头向句子尾扫描的过程中,所述的事件级策略网络在每个分词处检测触发词并且对检测出来的触发词分类事件类型;步骤3,一旦一个特定的事件被检测出来,所述的论元级策略网络将被触发,开始从头到尾扫描句子,以检测当前这个事件的参与论元;步骤4,一旦一个论元被识别出来,角色级策略网络将被触发,以预测当前事件下,这个论元在事件中扮演的角色;步骤5,当角色级策略网络角色分类完成,论元级策略网络会继续扫描之后的句子来寻找下一个论元,一旦当前事件下的论元级策略网络完成论元检测,事件级的策略网络将继续从当前事件的分词处往后扫描句子来检测句子包含的其他事件直到扫描到句子尾。
2.根据权利要求1所述的一种基于分层策略网络的事件抽取方法,其特征在于,采用智能体进行上述步骤2-5的执行,步骤2中,当智能体从头到尾顺序扫描句子时,所述的事件级策略网络在每个时间步持续根据策略来对选择进行采样,事件级选择通常包括非触发词或者触发词的特定事件类型集合;步骤3中,一个特定的事件被检测到,智能体将会转移至所述的论元级策略网络,从头到尾扫描句子时,在每个时间步根据策略来选择一个行动,论元级行动是对分词赋予一个特定的论元标签;步骤4中,一个特定的论元被检测出,智能体会转移至角色级网络对当前论元根据策略采样选择,角色级选择是角色类型的集合;步骤5中,当论元的角色分类完成后,智能体会转移至论元级策略网络继续扫描句子剩余的分词识别事件的其余论元,一旦当前事件下智能体结束对当前事件的参与论元的检测,智能体将会转移至事件级策略网络继续扫描剩下的句子识别其他的事件;在步骤2-5中,一旦一个选择或行动被采样到,就会有一个奖励被返回。
3.根据权利要求2所述的一种基于分层策略网络的事件抽取方法,其特征在于,给定输入文本S=w 1 ,w 2 ,...,w L ,所述的事件级策略网络的目的是检测触发词w i 所触发的事件类型,在当前词或时间步t处,事件级策略网络会采取随机策略μ来确定选择,然后使用获得的奖励来引导策略网络的策略学习;所述的事件级策略网络的选择 是从一个选择集合O e ={NE}∪ε中采样得来,其中NE代表非触发词的分词,ε是数据集中预先定义好的事件类型集合,用于指示当前触发词所触发的事件类型;所述的事件级策略网络过程的状态 是与过去时间步相关的,不仅编码当前输入,还编码了先前的环境状态, 是以下三个向量的联结:1)上一时间步的状态s t-1 ,其中如果智能体在时间步t-1发起了事件级策略过程,则s t-1 =s t-1 e ;否则s t-1 =s t-1 r ,s t-1 e 表示t-1时间步事件级策略网络的环境状态,s t-1 r 表示t-1时间步角色级策略网络的环境状态,2)事件类型向量 是从满足 的上一个选择学习而来,3)隐层状态向量h t ,它是在当前输入词向量w t 上进行Bi-LSTM获得的隐层状态向量,通过Bi-LSTM处理文本分词序列得到:由此, 表示为:最后,使用多层感知器MLP将状态表示为一个连续的实值向量 所述的事件级策略网络中的随机策略,即进行某个选择的策略,μ:S e →O e ,它采样一个选择 根据如下的概率分布:其中,W e 和b e 是参数, 是状态表示向量;所述的事件级策略网络的奖励最终的目的是识别和分类事件,触发词正确与否是中间结果,一旦事件级选择 被采样,智能体将获得一个即时的奖励,这个奖励能够反映在选择 下的短期回报,即时奖励通过对比句子S中事件类型的标准注释 得到:其中sgn(·)是符号函数,I(NE)是一个用来区分触发词和非触发词的奖励的开关函数:其中α是偏置权重,α<1,α越小,识别出非触发词获得的奖励更小,这能够避免模型学习到不重要的策略,去将所有的词都预测为NE,即非触发词;当事件级策略网络采样选择直至句子S中的最后一个词,智能体结束所有事件级选择之后,会获得一个最终奖励 这个最终状态的延迟reward由句子级事件检测表现定义:其中F 1 (·)表示句子级事件检测结果的F1分数,是句子级精确率和召回率的调和平均值。
4.根据权利要求3所述的一种基于分层策略网络的事件抽取方法,其特征在于,步骤3中,一个特定的事件在时间步t'被检测到,即 智能体将转移至论元级策略网络来预测每个论元在事件 的参与论元,在每个词或时间步t,论元级策略网络采取随机策略π来选取行动,并且用奖励来引导在当前事件下参与论元的学习,为了传递更加细粒度的事件信息来辅助论元决策,选择 以及来自事件级过程的状态表示 被整个论元级过程用作额外的输入;所述的论元级策略网络的行动 是给当前词赋予一个特定的论元标签, 是从一个行动空间A n ={B,I,O,E,S}∪{N}中选择,其中B/I/E表示当前分词在论元中的位置信息,B表示开始位置,I表示居间位置,E表示结束位置,O则标记与当前事件无关的论元,S表示单独分词的论元,N标记的是非论元词,在不同时间步,相同的论元可能会由于所处事件类型不同而被赋予不同的标签;以这种方式,多事件和误匹配问题能够被很自然地解决;论元级策略网络过程的状态 与过去时间步相关的,不仅编码当前输入,还编码了之前的环境状态和初始化事件类型的环境信息, 是以下四个向量的联结:1)上一时间步的状态s t-1 ,其中s t-1 是一个来自于事件级策略网络或论元级策略网络或角色级策略网络的状态,2)论元标签向量 它是从行动 中学习而来,3)事件状态表示 4)隐层状态向量h t ,它是从式1中相似的Bi-LSTM处理得到, 表示为:最后使用多层感知机MLP将状态表示为一个连续的实值向量 以事件类型 作为额外输入,用于论元检测的随机策略,即采取某个行动的策略为π:S n →A n ,它选择一个行动 根据如下的概率分布:其中W n 和b n 是参数, 是论元级状态表示向量, 是事件 的表示,W μ 是|ε|矩阵的一个数组, 表示将事件 通过数组进行映射得到事件的表示向量;一旦一个论元级行动 被选择,智能体将会得到一个即时的奖励 这个奖励通过与在预测到的事件类型 下的标准论元标注 对比得到,奖励计算如下:其中,I(N)是一个用于区分论元和非论元词的奖励的开关函数:其中,β是偏置权重,β<1,β越小意味着非论元词获得的奖励更小,能够避免智能体学习到不重要的策略,去把所有的行动都设置为N;智能体持续为每个分词选择行动直至最后一个分词的行动,当智能体结束在当前事件 下的所有论元级行动的选择,将获得一个最终的奖励
5.根据权利要求4所述的一种基于分层策略网络的事件抽取方法,其特征在于,步骤4中,一个参与论元在时间步t*被检测到,即 智能体将转移至角色级策略网络来预测论元 在事件 中扮演的角色,具体地,在每个词/时间步t,角色级策略网络会采取随机的策略μ来选取选择,并且用奖励来引导在当前事件下参与论元的论元角色学习,为了传递更加细粒度的事件信息和论元信息来辅助论元角色的决策,选择 以及行动 整个论元级过程用作额外的输入;角色级策略网络的 是给当前论元分类一个论元角色,选择空间是论元角色集,即O r =R,其中R是预定义的论元角色集合;角色级过程的状态 也是与过去时间步相关的,不仅编码当前输入,还编码了之前的环境状态, 是以下三个向量的联结:1)上一时间步的状态 2)论元角色向量 它是从选择 中学习而来, 3)隐层状态向量h t ,它是从式2中相似的Bi-LSTM处理得到, 表示为:最后使用多层感知机MLP将状态表示为一个连续的实值向量 为了定义角色集的策略,首先计算所有论元角色的分数:其中, 是当前论元的表示向量,h π 是在输入词向量上的隐层状态向量;由此,设计了一个基于事件架构的矩阵M∈{0,1} |ε|*|R| ,其中M[e][r]=1当且仅当事件e在事件架构信息中有角色r,使用这个矩阵来过滤掉不可能参与当前事件的论元角色;然后,用于角色检测的随机的策略为μ:S r →O r ,它选择一个选择 根据如下的概率分布:其中,W r 和b r 是参数;一旦一个角色级选择 被执行,智能体将会得到一个即时的奖励 这个奖励通过与在当前事件类型下的标准角色标注 对比得到,奖励计算如下:由于在论元级行动下角色级选择只会执行一步,因此最终的奖励
6.根据权利要求3至5任一所述的一种基于分层策略网络的事件抽取方法,其特征在于,所述的事件级策略网络在训练时,选择根据式3中的概率采样;所述的事件级策略网络在测试时,概率最大的选择会被选择,即 所述的论元级策略网络和角色级策略网络在训练和测试时,行动会以事件级策略网络相似的方式采样得到;事件级策略网络的转移取决于选择 如果在某个时间步 智能体将继续从一个新的事件级策略网络状态开始,否则,就意味着一个特定得事件被检测到,智能体将会发起一个新的子任务,转向论元级策略网络来检测当前事件的参与论元,之后,智能体将开始论元级的选择,并且其不会转移至事件级策略网络直到所有在当前事件 下的论元级选择被采样结束,事件级策略网络持续采样选择直至句子S中的最后一个词;论元级策略网络的转移取决于行动 如果在某个时间步 那么说明当前事件的一个参与论元被识别出,智能体将转移至角色级策略网络进行论元角色的分类,否则智能体将继续论元级策略网络;如果论元级策略网络执行到句尾,那么智能体将转移至事件级策略网络继续识别其余事件。
7.根据权利要求6所述的一种基于分层策略网络的事件抽取方法,其特征在于,为了优化事件级策略网络、论元级策略网络和角色级策略网络,分层策略网络的分层训练目标是去最大化来自三个阶段的由智能体在每个时间步t根据策略采样选择和行动所获得的期望的累计折扣奖励,累计折扣奖励的期望计算如下:其中, 是策略网络下奖励的期望计算,γ∈[0,1]是折扣率,T e 是事件级过程在结束之前总共经过的时间步,T n 是论元级过程的结束时间步,T r 是角色级过程结束之前经过的时间步; 为过程*在时间步k获得的奖励;然后将累计奖励分解为贝尔曼等式,从而在接下来可以用REINFORCE算法来优化,分解得到的贝尔曼等式如下:其中N是论元级过程在选择 下持续的时间步,所以智能体的下一选择是o t+N ,如果 则N=1;由于角色级策略网络在行动 只涉及一步的角色分类,因此论元级的过程中折扣率γ的指数为1;而论元级策略网络下没有其他步,因此折扣率γ的指数为0;R为每层策略网络最终会获得的最终奖励,r为即时奖励;对上述分解得到的贝尔曼等式,采用策略梯度法和REINFORCE算法进行优化,得到以下随机梯度,用于更新参数:
8.一种基于分层策略网络的事件抽取电子设备,其特征在于,包括:处理器;以及,存储器,用于存储所述处理器的可执行指令;其中,所述处理器配置为经由执行权利要求1至7任一所述可执行指令来执行基于分层策略网络的事件抽取方法。



