1.一种用于科学合作异质网络的作者迁移分类方法,其特征在于,包括以下步骤:步骤1,获取科学合作数据,构建异质科学合作网络;步骤2,将所述的异质科学合作网络中每个会议按照主题进行分类,每个作者根据其发表论文所属会议类别进行分组;步骤3,在所述的异质科学合作网络上进行邻居节点采样;步骤4,对采样的邻居节点进行邻居信息聚合;步骤5,在所述的异质科学合作网络上进行训练,学习得到异质网络表示;步骤6,使用作者表示向量和类别的训练数据集训练作者分类器;步骤7,训练完成的作者分类器用于对未知作者进行分类;所述的异质科学合作网络表示为G=(V,E,A,R),中V表示节点集合,E表示连边集合,所述的节点与连边分别存在映射φ:V→A和 E→R,其中A表示节点类型集合,包括作者类型、论文类型和会议类型,R表示连边类型集合,包括作者-写-论文类型,论文-引用-论文类型和论文-发表-会议类型;所述的邻居节点采样是基于元路径的,所述的元路径是定义在图G=(V,E,A,R)上的一条路径,表示为以下形式: 定义了节点A 1 和A k+1 之间的复合关系 其中 表示关系间复合运算,这条元路径表示A 1 和A k+1 通过k+1个节点和k条连边形成的语义信息被连接在一起;所述的邻居节点采样包括以下步骤,步骤201,对所述的异质科学合作网络的节点进行直接属性和间接属性聚合,步骤202,对所述的异质科学合作网络的节点进行直接邻居和间接邻居采样;所述的直接属性是节点本身具有的属性,所述的间接属性则是从异质科学合作网络中的相互关系中获得的额外属性,是对直接属性的补充;论文节点的直接属性包括论文标题、论文摘要和预训练结构嵌入,论文节点的间接属性包括录取会议的结构嵌入、论文作者的结构嵌入、引用文献的结构嵌入及引用文献的标题向量;作者节点的直接属性包括作者节点的结构嵌入,作者节点的间接属性是作者撰写论文的标题和摘要的向量表示;会议节点的直接属性包括会议节点的结构嵌入,会议节点的间接属性包括会议录取论文的标题和摘要的向量表示;所述的直接邻居是目标节点在异质科学合作网络中通过连边直接相连的邻居节点,间接邻居是目标节点在异质科学合作网络中通过元路径相连的邻居节点;步骤4中的训练过程中采用图上下文损失,并定义以下优化目标:其中,RW G 是在图G上通过随机游走采样的路径集合,<v,i,j>是一个三元组,其中v∈V是目标节点,i∈C v 是其在RW G 上的上下文邻居,j∈V是负采样节点,z' v 表示节点v的最终聚合向量,z' i 表示节点i的最终聚合向量,z' j 表示节点j的最终聚合向量,θ是sigmoid激活函数。
2.根据权利要求1所述的一种用于科学合作异质网络的作者迁移分类方法,其特征在于,所述的直接属性和间接属性聚合采用BiLSTM聚合,然后再进行均值池化,获得具有表达能力的d a 维度初始特征向量 x i 是通过BiLSTM获得的特征向量, 表示向量维度为d a ×1维。
3.根据权利要求1或2所述的一种用于科学合作异质网络的作者迁移分类方法,其特征在于,所述的邻居信息聚合包括,步骤301,对同类采样邻居进行同质信息聚合,步骤302,对不同类型邻居采用注意力机制进行异质信息聚合;所述的同质信息聚合首先采用BiLSTM对采样邻居的信息向量进行聚合,然后经过均值池化,得到信息聚合向量;所述的异质信息聚合中采用自注意力机制学习异质类型的聚合权重。
4.根据权利要求3所述的一种用于科学合作异质网络的作者迁移分类方法,其特征在于,在所述的同质信息聚合的BiLSTM中,通过将前向LSTM输出序列 和后向LSTM的输出序列 拼接来发现要素之间的顺序关联,节点m的i类型邻居的d维度的输出向量 由下式获得:其中, 为拼接操作,Neighbor i (m)表示节点m的邻居节点集合, 表示节点j由双向LSTM获得的前向表示向量, 表示节点j由双向LSTM获得的后向表示向量, 和 由通过LSTM获得:f j =σ(W f ·[h j-1 ,x j ]+b f )i j =σ(W i ·[h j-1 ,x j ]+b i )o j =σ(W o ·[h j-1 ,x j ]+b o )h j =o j ·tanh(C j )其中,f,i,o分别是遗忘门、输入门、输出门,W,b为可学习参数,d=2d a ,σ表示激活函数sigmoid,x j 表示通过BiLSTM获得的特征向量;所述的注意力机制的信息聚合中,给定类型目标节点k∈A和聚合向量y i ,i∈A,相应的注意力α ki 和自注意力系数α' k 为其中, 为拼接操作,x k 表示通过BiLSTM获得的特征向量, 为可学习的注意力参数, 为可学习的自注意力参数, 表示节点类型l的自注意力参数向量的转置,y l 节点类型为l的基于类型的聚合向量,σ为激活函数LeakyRelu,k类型节点的聚合向量为:z k =α' k x k +∑ i∈A α ki y i注意力机制模型独立重复n次,并将学习到的嵌入的均值作为最终的聚合向量:其中, 表示k类型节点的聚合向量的第i次计算结果。
5.根据权利要求1或4所述的一种用于科学合作异质网络的作者迁移分类方法,其特征在于,所述的元路径采用长度不超过3的可解释元路径,元路径的类型具体包括:A-P-A表示共同作者,A-P表示作者写论文,A-P-P表示作者在写作中引用了这篇论文,A-P-V表示作者的论文被会议接收,A-P-P-V表示引用的论文被会议接收,P-A表示论文是作者写的,P-P表示论文引用论文,P-A-P表示论文由同一作者撰写,P-V-P表示论文被同一会议接收,P-V表示论文被会议接收,P-P-V表示引用的论文被会议接收,V-P-A表示会议接收作者写的论文,V-P表示会议接收论文,V-P-P表示会议相关的引用论文,V-P-P-V表示会议相关的引用会议。
6.根据权利要求5所述的一种用于科学合作异质网络的作者迁移分类方法,其特征在于,进行邻居节点采样时,对每个节点采样相同数量的邻居,将采样邻居集合带入后续的邻居信息聚合中。
7.根据权利要求6所述的一种用于科学合作异质网络的作者迁移分类方法,其特征在于,进行邻居节点采样时,控制各类元路径采样的邻居数量之间的平衡关系。