1.一种用于知识图谱的实体对齐方法,其特征在于,包括以下步骤:步骤1,获取两个知识图谱的数据;步骤2,利用图卷积网络学习实体的结构向量;将实体的名字表示为词向量;步骤3,计算实体的结构距离和词特征距离;步骤4,并将两个距离融合综合距离以表示实体的相似程度;步骤5,根据相似程度的计算结果进行实体识别对齐,获得相似实体对;所述的两个知识图谱表示为,G 1 =(E 1 ,R 1 ,T 1 )和G 2 =(E 2 ,R 2 ,T 2 ),其中E代表实体,R代表关系, 代表图谱中的三元组,已知实体对表示为 所述的步骤2中利用两个两层图卷积网络,分别用来处理两个知识图谱数据并生成相应的实体结构向量;步骤3中两个知识图谱的实体e 1 ∈G 1 和e 2 ∈G 2 在结构空间下所述的结构距离为D s (e 1 ,e 2 )=||e 1 -e 2 || l1 /d s ,d s 为结构矩阵维度;所述的词特征距离选用实体名的语义相似度,将平均词向量作为实体名向量,计算实体名向量在文本特征空间下的距离,具体地,所述的词特征距离为D t (e 1 ,e 2 )=||ne(e 1 )-ne(e 2 )|| l1 /d t ,假设实体e名字中包含词语w 1 ,w 2 ,...,w p ,那么实体名向量可表示为这些词向量的平均,即 其中 w i 是w i 的词向量,d t 是名字向量矩阵维度;进一步,通过词移距离模型计算所述的词特征距离,所述的词移距离模型用于衡量不同句子间的差异性,词移距离表示为实体中所有词的嵌入向量需要移动到达另一个实体中所有词的嵌入向量的最小距离值;步骤4中所述的综合距离的融合公式为:D(e 1 ,e 2 )=αD s (e 1 ,e 2 )+(1-α)D t (e 1 ,e 2 )其中α是用来调整两种特征权重的超参数。
2.根据权利要求1所述的实体对齐方法,其特征在于,所述的图卷积网络,输入是实体的特征矩阵 以及图的邻接矩阵A,输出是融入了结构信息的特征矩阵 N代表图谱中节点的数目,而P和F分别代表输入和输出矩阵特征的维度,假设第l层的输入为节点的特征矩阵 其中d l 代表第l层特征矩阵的维度,对于第一层,H 1 =X,d 1 =P;第l层输出为 其中 I为单位矩阵, 为 的对角矩阵, 为第l层的参数矩阵,d l+1 是下一层特征矩阵的维度,激活函数σ常被设为ReLU,对于最后一层,H l+1 =Z,d l+1 =F。
3.根据权利要求2所述的实体对齐方法,其特征在于,初始的特征矩阵X从L2正则化的截尾正态分布中抽样得到,并通过GCN各层训练更新,进而充分捕捉知识图谱中的结构信息并生成输出特征矩阵Z;特征矩阵的维度一直设置为d s ,P=F=d l =d s ,而两个GCN在两层中共享特征矩阵W 1 和W 2 。
4.根据权利要求3所述的实体对齐方法,其特征在于,训练目标为最小化下述损失值:其中[x] + =max{0,x}, 代表基于已知实体对(e 1 ,e 2 ),将e 1 或者e 2 替换成随机实体生成的负样本集合, e 代表实体e的结构向量,γ代表将正负样本分隔的端距,采用随机梯度下降进行模型优化。