1.一种基于改进特征融合的语义关系抽取方法,其特征在于,包括以下步骤:步骤1,建立中文文本训练样本集;步骤2,构建语义关系抽取模型;步骤3,训练语义关系抽取模型;步骤4,建立待抽取语义的数据集;步骤5,利用训练好的语义关系抽取模型从待抽取语义的数据集中提取语义关系;所述的训练样本集是利用知识图谱远程监督维基百科上的语料自动生成弱标注的数据,每条训练实例包含目标实体对、分词序列、依存路径和弱监督标签;所述的依存路径为保留谓词的依存路径,所述的依存路径包含两个子路径,子路径分别为根节点分别到两个实体的最短路径;所述的语义关系抽取模型包括输入层、嵌入层、卷积层、特征融合层、全连接层,上述各层先后依次连接,所述输入层为描述某一实体对的全部分词序列和对应依存路径所构成的实例包提供一个输入接口;所述嵌入层将所输入的分词序列和对应依存路径通过表示学习方式映射到低维向量空间;所述卷积层为两个独立的卷积网络,分别用于提取实例包中所有分词序列和所有对应依存路径的语义特征;所述特征融合层将来自分词序列和对应依存路径两方面的互补语义特征进行融合;所述全连接层将实例映射至已定义的关系集合上,获得实体对之间的语义关系。
2.根据权利要求1所述的语义关系抽取方法,其特征在于,所述的语义关系抽取模型还包括多实例学习机制模块,从全连接层中获取数据,将学习的结果反馈到卷积层,指导卷积层的计算操作;所述的多实例学习机制模块在模型学习过程中选择实例包中最好的实例作为训练和预测实例,丢弃其他实例,抑制噪声实例影响。
3.根据权利要求2所述的语义关系抽取方法,其特征在于,训练语义关系抽取模型的过程为:初始化后,以交叉熵作为损失函数,通过多实例学习方法,采用随机梯度下降法对所述的语义关系抽取模型进行迭代更新模型参数,每迭代一次检验一次梯度,以寻求各网络层权重和偏置的最优解,迭代多次后得到本次训练的最优语义关系抽取模型。
4.根据权利要求2所述的语义关系抽取方法,其特征在于,所述输入层的输入接口数量为2,分别对应分词序列和依存路径,每一条实例的输入定义如下: 其中,x代表输入的分词序列, 代表分词序列中的第i个分词,s代表输入的依存路径, 代表依存路径上的第i个分词;所述的嵌入层分别将输入的分词序列和依存路径上的每一个分词映射为向量表示,每个分词的向量表示包含词向量、位置向量和词性标注向量三部分,其中词向量通过Word2Vec算法预先训练得到,包含分词的语义信息,位置向量通过随机初始化得到,包含分词在分词序列或依存路径中的位置信息,词性标注向量表示为单位向量,包含分词的词性信息;在分词序列或者依存路径中的任意一个分词可以进行如下的向量表示:w i =[v word :v position :v tag ],其中,v word ,v position 和v tag 分别表示分词的词向量,位置向量和词性标注向量,w i 的维度为k;将每一个分词向量表示按照分词序列和依存路径中的顺序先后水平连接,得到分词序列和依存路径的向量表示,表示为: 其中,X代表分词序列经过嵌入层之后的向量表示, 代表分词序列中第i个分词的向量表示,S代表依存路径经过嵌入层之后的向量表示,W i s 代表依存路径中第i个分词的向量表示。
5.根据权利要求4所述的语义关系抽取方法,其特征在于,所述的卷积层为两个独立的卷积网络具有相同的运算机制,每一个卷积网络设置多个卷积滤子,表示为 卷积滤子数量为d,窗口大小为w,卷积操作定义为: 而 其中,1<i<d,1≤j≤m-w+1, 为第i个卷积滤子,s i:j 为第i个分词到第j个分词向量表示的水平串联, 表示矩阵的点积运算,最终每一个卷积滤子生成一个中间特征向量 全部卷积滤子生成的中间特征向量序列为C={c 1 ,c 2 ,…,c d },最大池化用来提取每一个维度中最显著的特征,定义为: c ij 为C中对应位置的元素,最终生成每一条分词序列的特征向量
6.根据权利要求5所述的语义关系抽取方法,其特征在于,所述的特征融合层对来自分词序列和对应依存路径两方面的特征向量的加权求和,定义为:p=αp x +(1-α)p s ,其中,α为权重稀疏,p s 为每条依存路径的特征向量,p x 为每条分词序列的特征向量。
7.根据权利要求6所述的语义关系抽取方法,其特征在于,所述的全连接层将实例映射至已定义的关系集合上,获得实体对之间的语义关系,其定义为:o=Up+v,其中, 为系数矩阵, 为偏置, 为对应于所有关系类型的置信分数,其中n r 是所有关系的数量,置信分数最高的关系被认为是该实体对之间的语义关系。
8.根据权利要求7所述的语义关系抽取方法,其特征在于,所述的多实例学习机制模块中的训练数据有一系列实例包,表示为B={B 1 ,B 2 ,…,B N },任一个实例包B i 中包含|B i |个实例,在该机制下,损失函数定义为:其中, 为实例包B i 中的一个实例,o kr 为实例 对应关系r的置信分数,θ为模型中的全部参数,θ更新的原则为: 其中,η为学习率,训练语义关系抽取模型的过程为:初始化后,以交叉熵作为损失函数,通过多实例学习方法,采用随机梯度下降法对所述的语义关系抽取模型进行迭代更新模型参数,每迭代一次检验一次梯度,以寻求各网络层权重和偏置的最优解,迭代多次后得到本次训练的最优语义关系抽取模型。
9.根据权利要求8所述的语义关系抽取方法,其特征在于,训练语义关系抽取模型包括如下步骤:步骤301,将训练样本数据集中的实例包写入到数据文件中,数据文件的数据格式与语义关系抽取模型的读入数据接口相符;步骤302,设定训练参数:包括读入文件路径,迭代次数,学习率,设定每一网络层的所用维度和尺寸,初始训练权重和训练偏置;步骤303,加载训练文件:加载语义关系抽取模型定义文件、网络层参数定义文件和训练数据组成的训练集;步骤304,通过多实例学习方法,采用随机梯度下降法对语义关系抽取模型进行迭代更新模型参数,每迭代一次检验一次梯度,以寻求各网络层权重和偏置的最优解,迭代多次后得到本次训练的最优语义关系抽取模型;步骤305,将样本集中后30%的数据作为测试样本集,将测试样本集采取训练样本集相同预处理方式,利用得到的语义关系预测系统对测试样本集中的数据进行测试。