1.基于负采样和加权的知识图谱嵌入方法,其特征在于,包括以下步骤:获取医药数据集,医药数据集中的实体包括药物、疾病、症状;基于预训练得到的嵌入向量和设计的高质量候选负样本集构建策略,为所有正三元组采样高质量的候选负样本集;根据基于翻译的知识图谱嵌入模型,计算三元组及其对应的负三元组的评分函数值;统计出数据集中的相关频次数据,计算每个三元组的基于频次的权重W f ;根据评分函数值以及W f ,计算三元组集的损失L,得到训练框架最终的损失函数;采用随机梯度下降法SGD来优化训练模型的损失函数,学习基于翻译的知识图谱嵌入模型的最优参数,包括最优的嵌入向量h, r, t,h, t, r分别为三元组中头实体、尾实体的嵌入向量、关系的嵌入向量;输出药物与疾病、症状之间的潜在关联关系;其中,模型训练的损失函数L定义为:其中,( h, r, t )和( h', r, t')分别表示正三元组和负三元组,S和S'分别表示正三元组集和负三元组集;在损失函数中增加基于三元组频次的权重因子,根据参与训练的三元组中实体和关系在数据集中出现的频次,为三元组的损失函数设置不同的权重;具体来说,为频次较高的实体和关系赋予较低的权重,而为频次较低的实体和关系赋予较高的权重,通过这种方式,增加对长尾实体和关系的训练关注度,以期学习出更好的嵌入;定义三元组基于三元组频次的权重因子W f 为:其中,f h , f t , f r 分别表示实体h, t及关系r在数据集中出现的频次, , 分别表示该数据集中实体和关系的中位频次,按照二八定律,将中位频次定义为按照出现的频次从高到低排名20%的实体和关系的频次,w h 、w t 、w r 分别是实体h, t及关系r的频次权重因子;基于三元组频次的权重因子W f ,对于低频三元组,即三元组中的实体和者关系都是出现频次低于中位频次的低频实体和关系,该低频实体或关系的权重大于1,低频三元组的损失函数中的W f 权重值大于1,从而在训练中提高对于低频实体和关系的关注;同理,对于高频三元组,即三元组中都是出现频次高于中位频次的高频实体和关系,该高频实体或关系的权重小于1,高频三元组的损失函数中的W f 权重将小于1,从而在训练中降低对于这些高频实体、关系的关注;将基于三元组频次的权重因子W f 应用于模型训练的损失函数,得到: 。
2.根据权利要求1所述的基于负采样和加权的知识图谱嵌入方法,其特征在于,在训练过程中,根据当时得到的知识图谱嵌入向量对候选负样本集进行一定频次的动态更新,提高候选负样本质量。
3.根据权利要求2所述的基于负采样和加权的知识图谱嵌入方法,其特征在于,为避免过拟合,在模型训练时强制约束数据集中的所有实体和关系的2阶范数小于等于1,即||h|| 2 ≤ 1,||r|| 2 ≤ 1,||t|| 2 ≤ 1。
4.根据权利要求3所述的基于负采样和加权的知识图谱嵌入方法,其特征在于,选取非采样知识图嵌入框架NS-KGE作为预训练模型,从而快速得到一个初始的知识图谱嵌入向量表示。
5.根据权利要求4所述的基于负采样和加权的知识图谱嵌入方法,其特征在于, 所述高质量候选负样本集构建策略,为所有正三元组构建候选负样本集,作为负样本的候选库,以便从中采样高质量的负样本参与模型训练,从而提升模型训练的性能;高质量候选负样本集构建策略具体包括:候选负样本集包括候选头实体集,即替换头实体获得的候选负样本集,以及候选尾实体集,即替换尾实体获得的候选负样本集;对每个三元组采样大小为N = N h +N t 的候选负样本集,其中,候选头实体集的大小为N h ,候选尾实体集的大小为N t ;设置N h , N t 时,考虑三元组所对应的一对多或多对一等关系类型,具体来说,对于一对多关系类型的三元组,多设置一些候选头实体,因而,候选头实体集的大小相对于候选头尾实体集的大小更大;而对于多对一关系类型的三元组,多设置一些候选尾实体,候选尾实体集的大小相对于候选头实体集的大小更大;分别定义候选头实体集的大小为N h 及候选尾实体集的大小为N t ,即其中,t rh 是指知识图谱中关系为r的所有三元组头实体所连接尾实体的平均数量,h rt 是指关系为r的所有三元组中尾实体所连接头实体的平均数量;构建三元组(h, r, t)候选头实体集和候选尾实体集,最终得到三元组(h, r, t)的大小为N =N h +N t 的候选负样本集;执行基于预训练的高质量候选负样本集构建流程,将数据集中的所有三元组基于该流程构建其对应的候选负样本集,得到该数据集对应的高质量的候选负样本集;另外,为了避免由于预训练模型自身的性能局限造成的候选负样本集质量不高,在训练过程中,根据当时得到的知识图谱嵌入向量,按照上述步骤重新对负样本集进行一定频次的动态更新,从而为下一步基于损失函数的优化训练提供高质量负样本保障。
6.根据权利要求5所述的基于负采样和加权的知识图谱嵌入方法,其特征在于,所述基于翻译的知识图嵌入模型为TransE模型;对于TransE,为了便于对正、负三元组的损失函数进行加权,将基于边际超参数的损失函数改造为:其中,γ为边际参数,σ是sigmoid激活函数,( h i ', r, t i ')是( h, r, t )对应的参与训练的负三元组,TransE模型的损失函数L为: 。