1.基于对比学习预训练的异质信息网络关键词生成方法,其特征在于,包括以下步骤:步骤1,采用文本编码器将文本编码成低维向量,生成文本表示;步骤2,采用图谱编码器对异质信息网络的结构特征、异质特征和自监督信息进行编码,获得图表示;步骤3,通过对比学习,将文本表示和图表示进行预训练对齐;步骤4,引入自动生成的可学习且连续的提示向量,将标识的自然语言语句提供给文本编码器,并将自然语言语句与图谱编码器生成的结构和异质特征表示进行比较来生成分类时的权重,融合得到单一表示;步骤5,利用获得的单一表示,进行异质信息网络的关键字生成;其中,步骤4中所述的引入自动生成的可学习且连续的提示向量,是从数据中端到端学习的连续向量来替换离散的文本单词,输入到文本编码器的提示 设计为:其中, 表示节点的类别标签, 是一个与训练阶段的词表示维度相同的词向量, 是一个超参数,表示提示中连续文本向量的个数,将连续提示 输入给文本编码器 后,即可得到代表节点概念的分类权重向量,预测概率计算为其中,每个提示 中的类别标记被第 个类别名的词向量表示替换, 表示将提示 送入文本编码器后得到的向量;在步骤4中获得更准确的提示向量,采用基于文本编码器和图谱编码器之间的残差连接来利用给定节点的上下文子图,将类别标签的文本表示和子图中的节点表示输入到文本-子图自注意力层,帮助文本特征找到给定节点的最相关的上下文节点;获得文本-子图对比器的输出 之后,通过残差连接更新文本特征,其中 是一个可学习的参数,用于控制残差连接的程度。
2.根据权利要求1所述的基于对比学习预训练的异质信息网络关键词生成方法,其特征在于,步骤2中具体包括以下步骤:步骤201,对异质子图进行采样,对于给定的节点,需要先对节点周围的子图进行采样;步骤202,采用自编码器来捕获子图的结构信息,给定子图的邻接矩阵 ,它将首先由编码器处理以生成多层的潜在表示,然后,解码器将上述过程逆向得到重构输出 ,自编码器旨在最小化输入和输出的重构误差,使具有相似结构的节点具有相似的表示,损失函数 计算公式如下:其中,B是施加于非零元素的惩罚稀疏,以减轻稀疏性问题, 表示按位相乘, 表示正则化操作;步骤203,探索异质信息网络的异质特征,将具有相同类型的节点分组在一起,在每个组上应用Bi-LSTM来对特定于类型的特征进行建模,给定类型 的节点组 ,节点 的表示 计算如下:其中, 表示将Bi-LSTM应用于节点 的类型分组上, 表示节点组 的数量;然后,应用注意力机制来聚合所有类型组以生成给定节点的表示 ,其中, 表示激活函数,使用LeakyReLU, 是权重参数, 表示 的转置, 是节点 的表示, 表示类型的集合, 表示注意力权重;步骤204,基于自监督信息预训练子图,引入两个预训练任务,掩码节点建模任务和边重构任务,以实现节点级和边级的图谱探索。
3.根据权利要求2所述的基于对比学习预训练的异质信息网络关键词生成方法,其特征在于,所述的掩码节点建模任务,根据节点的排名进行排序,随机抽取预设比例的节点以[MASK]标识代替,排序好的节点会被送入到Transformer的编码器中,由Bi-LSTM生成的表示作为标识表示,排序信息会作为位置向量,由Transformer编码器学习得到的隐藏层 送入到前馈层,以预测目标节点,数学表示为:其中, 是前馈层的输出, 表示由前馈层, 表示激活函数, 是与输入节点表示矩阵共享的用于分类的权重, 是子图的节点数, 是隐藏层向量的维度, 是 在所有节点上的预测分布,在训练时,使用独热标签 和预测 之间的交叉熵,损失函数 计算如下:其中, 和 是 和 的第 个分量, 表示标签的集合, 表示预测概率的集合;所述的边重构任务,在子图中对正边和负边进行采样,正边是确实存在于原始子图中的边,而负边在原始子图中不存在,给定正边和负边合并集 ,通过一对节点之间的内积来计算边重构的分数,即 , 是计算得分, 是节点 的表示, 是内积, 是节点 的表示,采用预测边和真实边之间的二元交叉熵以计算边重构的损失函数 : , 表示节点对的数量, 表示二元交叉熵, 表示节点 和节点 的实际得分, 表示节点 和节点 的连边。
4.根据权利要求2所述的基于对比学习预训练的异质信息网络关键词生成方法,其特征在于,所述的对节点周围的子图进行采样采用带重启的随机游走的抽样策略,将迭代地遍历给定节点 的邻域,并有一定的概率返回起始节点 ,为了对重要性更高的节点进行采样,让随机游走策略首先到达高排序的节点,为了使图谱编码器具有异质性,将遍历限制为对所有类型的节点进行采样。
5.根据权利要求1所述的基于对比学习预训练的异质信息网络关键词生成方法,其特征在于,所述的对比学习用于在训练过程中对齐文本表示和图表示,学习目标被设计为对比损失函数,给定一批文本-子图对,最大化匹配的文本-子图对的相似度分数,同时最小化不匹配文本-子图对的分数。
6.根据权利要求5所述的基于对比学习预训练的异质信息网络关键词生成方法,其特征在于,在所述的对比学习的过程中,给定一个节点 ,图谱编码器学习的节点表示为 ,文本编码器生成的权重向量表示为 ,其中 表示类别的数量,每个权重 都是从提示中学习的,预测概率计算为:其中, 是学习得到的温度超参数, 表示相似度分数, 表示文本权重向量 和节点表示向量 的相似度分数。
7.根据权利要求1所述的基于对比学习预训练的异质信息网络关键词生成方法,其特征在于,所述的文本编码器采用 Sentence-BERT模型,生成固定大小的文本表示。
8.根据权利要求7所述的基于对比学习预训练的异质信息网络关键词生成方法,其特征在于,将 初始化为 。