有效
一种基于路径质量判别的强化学习知识图谱推理方法
贾海涛、罗林洁、李嘉豪、任利、许文波、周焕来、贾宇明
电子科技大学
摘要
本发明提出一种基于路径质量评估的知识图谱推理算法RLKGR‑PQD。该算法包括:改进基准算法加入路径质量评估模块并给出相应的总体框架图,然后在两组公开数据集(FB15K‑237和NELL‑995)上对基准模型和改进后的RLKGR‑PQD模型进行实验,最后实验分析验证了RLKGR‑PQD算法的有效性,实验结果表明改进算法有效地提升了查询问答中的MRR指标。
1.一种基于路径质量判别的强化学习知识图谱推理方法,该方法包括以下步骤:步骤1:实体描述关键信息提取实体描述集合Descriptions即为本方法的语料库,每一个实体对应的描述文本为一篇文档;首先TF-IDF算法计算某个词语word在某篇文档description中的词频(TermFrequency,TF),词语word在描述文本description中出现次数越多,那么该词语word可能越能反应description的主题,具有更重要的意义;为防止统计词频时结果偏向总字数多的描述文本,将最终的统计结果进行归一化;最后计算某个词语word在某篇文档description中的词频-逆向文件频率(TF-IDF),得到某个文档中各个词语TF-IDF后进行降序排序即可得到重要程度排名高的词语集合作为该篇描述文本的关键词组;其中词语word在某篇描述文本的TF-IDF值就是其TF值tf word,description 和IDF值idf word,description 的乘积;完成计算流程后即可得到每篇描述文本的关键词组;步骤2:类别信息提取由各类百科作为结构化数据来源的知识图谱的实体本身带有分类相关信息,在NELL-995中,观察可得到其实体格式均为“concept_”加之“类别词_”加之下划线相连接的实体名,其中concept表示该词组为一个概念;使用形式为“concept_*_”的正则过滤出模型需要的类别相关词;接下来提取关系对应的类别信息,来源于各类百科的知识图谱中的关系也有可作为分类依据的前缀描述或详细分级路径;在NELL-995中,数据集中关系有类别词相关的前缀描述,其关系格式为“关系名”或“关系名_inv”,其中后缀“inv”表示为逆向关系;观察到类别词主要为关系名中介词前后内容,使用词性标注后抽取出介词前后重要内容,再对抽取出的数据进行人工调整;步骤3:基于文本相似度的路径质量评估智能体通过路径path=(e h ,r 1 ,e 1 ,r 2 ,e 2 ,...,r m ,e m ,r m+1 ,e target )从头实体e h 到达目标尾实体e target ,对应的路径实体集合即智能体到达尾实体前经过的实体,具体为entities={e 1 ,e 2 ,...,e m };提取出查询中头实体的描述信息的关键词,从维基百科爬取实体描述信息,并基于TF-IDF进行关键词提取,关键词集合具体为words={word 1 ,word 2 ,...,word n };得到了路径实体集合与头实体描述信息关键词集合之后,我们需要计算两者之间的语义相似度;针对两个词语集合,我们以Word2Vec作为文本表示模型,以cosine距离为相似度度量方法,计算出词组之间的相似度矩阵;路径实体集合所包含的实体个数为m,头实体描述信息的关键词集合所包含的实体个数为n,两个词组之间的相似度可由一个m×n维的相似度矩阵X i=1,2,...,m;j=1,2,...,n 表示,矩阵中的元素X ij 为路径实体集合中的实体e i 和头实体描述信息的关键词集合中的实体关系word j 的语义相似度;路径实体集合与头实体描述信息关键词集合的语义相似度SIM(entities,words)是由集合中各个实体和关键词的语义相似度得到的,具体地由m×n维的相似度矩阵X i=1,2,...,m;j=1,2,...,n 得到集合间语义相似度SIM(entities,words);智能体从头实体e h 出发,经过多次跳转经过多个实体与关系边到达尾实体e target ,其中经过的实体集合为entities={e 1 ,e 2 ,...,e m };通过提取实体集合中各个元素的类别信息,得到路径实体类别集合classes={class 1 ,class 2 ,...,class m };再通过用样的方式得到查询q=(e h ,r)中的关系r对应的类别信息class relation ;得到路径实体类别集合和查询中关系的类别之后,我们需要以数值的方式衡量两者之间的语义相似度,我们同样使用Word2Vec作为文本表示模型,以cosine距离为相似度度量方法,计算出词组与关系之间的相似度矩阵;路径实体类别集合所包含的实体类别个数为m,查询中关系的类别所包含的类别词个数为1,词组与关系之间的相似度可由一个m×1维的相似度矩阵X i=1,2,...,m 表示,矩阵中的元素Y i 为路径实体类别集合中的实体类别class i 和查询中关系的类别词class relation 的语义相似度;路径实体类别集合和查询中关系的类别合的语义相似度SIM(classes,class relation )是由集合中各个实体和关键词的语义相似度得到的,具体地由m×1维的相似度矩阵X i=1,2,...,m 得到集合间语义相似度SIM(classes,class relation );步骤4:参数设置在参数选择方面,基于路径质量评估的强化学习知识图谱推理算法在质量评估模块方面需要确定的超参数主要包括路径实体集合与头实体描述信息关键词集合的语义相似度SIM(entities,words)的阈值α和路径实体类别集合和查询中关系的类别合的语义相似度SIM(classes,class relation )的阈值β并且α,β∈(0,1);本文遵循相关工作中的参数选择方法,使用网格搜索法对以上参数进行确定;选取搜索范围后,设置参数α的选取范围为{0.2,0.3,0.4},参数β的范围为{0.10,0.15,0.20};对于基于路径质量评估的强化学习知识图谱推理模型来说,实体和关系嵌入尺寸的大小设置为200;3层LSTM的隐藏大小为200,β表示熵正则化常数,值在0-0.1之内;我们使用Adam优化器。
2.如权利要求1所述方法,其特征在于,步骤1使用TF-IDF方法提取实体描述文本中关键词。
3.如权利要求1所述方法,其特征在于,步骤3中使用基于文本相似度计算、Word2Vec模型完成对智能体游走过程得到的路径的质量评估。
暂无引用专利





