1.一种专业领域术语实体词向量自校正方法,其特征在于,包括:步骤1、通过下游关系抽取任务,微调预训练语言模型,编码领域术语实体解释文本得到领域术语实体语义词向量;步骤2、通过关系抽取模型,构建领域术语知识图谱,并通过领域术语知识图谱构建实体关系矩阵;具体包括:步骤21、基于原始语料,构建与每条原始语料对应的索引,将所述索引及原始语料输入关系抽取模型,输出关系标签,并得到由原始语料中的术语实体对及所述关系标签构成的三元组;步骤22、将若干个三元组,通过关系连接成领域术语知识图谱,并将关系权重赋值,得到权重矩阵;步骤23、基于所述领域术语知识图谱构建实体关系矩阵;通过N个术语节点构建N*N邻接矩阵,所述邻接矩阵中每行的值表示某个术语节点到该图谱中其余节点的路径信息:与该术语节点直接相连的术语节点,矩阵对应的值为这两个节点之间所有关系的权重和;与该术语节点不直接相连的术语节点,矩阵对应的值为0;通过L1范数归一方法,使每行所有权重的绝对值和为1,将该图谱中某个节点到其余节点的权重归一化,具体公式为: ; ;其中, 表示一行中的第 个值; 表示一行的总数;根据每个权重值计算术语节点之间的 正点互信息,具体公式为: ; ;其中, 表示点互信息值,用于衡量两个随机变量之间的关联性; 表示两个事物 同时出现的概率; 表示两个事物 的边缘计数;通过正点互信息计算,将权重矩阵转化为实体关系矩阵;步骤3、通过实体关系矩阵校正所述领域术语实体语义词向量,输出包含专业领域语义与结构信息的实体词向量集。
2.根据权利要求1所述的方法,其特征在于,所述步骤1包括:步骤11、通过领域术语解释文本的数据特征,定义领域术语之间的关系;步骤12、标记领域术语解释文本的原始语料,在原始语料中通过第一特殊符号标记头实体的开始位置及结束位置,通过第二特殊符号标记尾实体的开始位置及结束位置,将每条语料中头实体和尾实体之间的关系拼接到句首并通过加注第三特殊符号作为该条语料的关系标签;通过预训练语言模型的分词器,以字为粒度对语料进行切分,将每条解释文本序列,拼接成预设字符长度的输入序列;步骤13、将处理后的输入序列输入至预训练语言模型,所述预训练语言模型将每条输入序列转换为向量矩阵,通过多层自注意力机制层进行编码,得到每个子词的向量表示;抽取句向量代表及术语实体对向量,并通过若干全连接层映射至同一语义空间后进行拼接,输入至全连接层后,再连接SoftMax层预测关系;步骤14、通过多轮训练,当模型关系抽取任务损失函数值收敛至稳定值后,保存预训练语言模型,通过微调后的预训练语言模型编码领域术语实体,根据实体掩码序列将头尾实体的向量表示进行输出,得到该领域的术语实体词向量。
3.根据权利要求2所述的方法,其特征在于,所述步骤11中定义领域术语之间的关系的方法包括:基于显示关系的关键词,定义五类关系:属种关系、整体部分关系、同义关系、反义关系及其他关系。
4.根据权利要求1所述的方法,其特征在于,在得到实体关系矩阵后还进行降维处理,具体包括:通过SVD奇异值将实体关系矩阵分解为m*m维左奇异矩阵、奇异值对角矩阵和n*n维右奇异矩阵;选取前K个奇异值,则左奇异矩阵从m*m维下降为m*k维,右奇异矩阵从n*n维下降为k*n维。
5.根据权利要求1所述的方法,其特征在于,所述步骤3具体包括:步骤31、对每个领域术语实体语义词向量预测新向量,所述新向量既在语义空间中靠近原始语义向量,又要根据实体关系矩阵中术语的结构信息,靠近领域术语知识图谱中的相关邻居节点,公式为: ;其中, 表示校正过程的目标函数; 表示术语 的实体语义词向量; 表示新向量; 是 在领域术语知识图谱中所有的邻居节点,二者之间存在关系 ; 表示术语 与术语 之间的关系; 及 均为向量校正常量;步骤32、对 一阶求导,令导数为0,得到每个 的一次迭代更新,公式为: ;步骤33、进行多次迭代,直至达到迭代结束条件。
6.根据权利要求5所述的方法,其特征在于,所述迭代结束条件为达到预设迭代次数。
7.一种采用如权利要求1-6中任一所述方法的专业领域术语实体词向量自校正系统,其特征在于,包括:数据采集模块、数据处理模块及结果生成模块:所述数据采集模块,用于采集领域术语原始语料;所述数据处理模块包括预处理单元、模型训练单元、关系抽取单元、语义向量编码单元、术语图谱构建单元、结构矩阵构建单元及校正单元:所述预处理单元,标记所述领域术语原始语料,构建关系抽取模型的训练集;所述模型训练单元,基于所述训练集,训练所述关系抽取模型;所述关系抽取单元,基于所述领域术语原始语料,通过训练后的所述关系抽取模型,抽取术语实体对所对应的关系,得到三元组;所述语义向量编码单元,用于从所述关系抽取模型的编码层获取术语实体词向量;所述术语图谱构建单元,用于将所述三元组通过关系连接成领域术语知识图谱;所述结构矩阵构建单元,用于将所述领域术语知识图谱中的结构信息记录并转化为实体关系矩阵;所述校正单元,通过所述实体关系矩阵校正术语实体词向量;所述结果生成模块,用于将校正后的术语实体词向量整理成实体词向量集并外发。
8.一种专业领域术语实体词向量自校正装置,其特征在于,包括处理器、存储器及总线,所述存储器存储可由处理器读取的指令及数据;所述处理器用于调用所述存储器中的指令及数据,以执行如权利要求1~6任一所述的方法;所述总线连接各功能部件之间传送信息。