1.基于超图的标签聚类方法,将标签视为超图中的顶点,定义超图G=(V,ε,W),其中,V=[v i ]表示超图的顶点的集合,ε=[e i ]表示超边的集合,n=|V|表示顶点个数,m=|ε|表示超边个数,W=diag(w 1 ,w 2 ,...,w n )为m×m的对角矩阵,主对角线上的元素w i 分别表示各个超边的权值,将W初始化为单位矩阵以视为所有超边的权值相同,其特征在于,步骤包括:基于标签数据集,构建标签统计超图,基于先验知识,构建标签知识超图;所述标签统计超图构建步骤包括:对标签数据集中的标签对的共现次数进行计数,获得标签共现矩阵M;基于标签共现矩阵M,利用条件概率公式计算标签的条件概率矩阵P;基于标签的条件概率矩阵P-,利用最近邻搜索方法构建超图关联矩阵H s ;所述超图关联矩阵H s 表示为:其中,v i 表示第i个顶点,i=1,2,...,n,j=1,2,...,m,V j 表示第j个顶点的K个最近邻居集合;在标签统计超图H s 的基础上添加一个单位矩阵,得到标签统计超图关联矩阵H′ s ,所述标签统计超图关联矩阵表示标签统计超图结构;其中,条件概率矩阵P∈R n×n ,条件概率矩阵P中的元素P ij =P(l j |l i )表示标签l i 出现时标签l j 出现的概率,i,j=1,2,...,n;将标签统计超图和标签知识超图进行叠加得到叠加超图;基于标签数据集,采用Bert预训练语言模型生产标签初始特征向量;在叠加超图上对标签初始特征向量进行卷积运算获得新的标签特征表示,将新的特征表示作为聚类算法的输入,从而完成标签聚类。
2.根据权利要求1所述的基于超图的标签聚类方法,其特征在于,所述标签知识超图构建步骤为:根据ConceptNet知识图谱的API接口来抽取数据集中任意标签对(l i ,l j )的关系集合,取其中最大的关系标签权值作为两个标签的相关程度的数值体现,进而构建标签相关性矩阵A k ;基于标签相关性矩阵A k ,利用最近邻搜索方法构建标签知识超图关联矩阵H k ,所述标签知识超图关联矩阵表示标签知识超图结构。
3.根据权利要求2所述的基于超图的标签聚类方法,其特征在于,所述标签相关性矩阵A k 表示为:其中,S ij 是标签i和标签j之间的关系集合,w re 表示关系re的权重,|S ij |表示集合S ij 的元素个数。
4.根据权利要求1所述的基于超图的标签聚类方法,其特征在于,将标签统计超图与标签知识超图的关联矩阵H′ s 和H k 进行连接,形成所述叠加超图关联矩阵H,所述叠加超图关联矩阵表示叠加超图结构,所述叠加超图关联矩阵H表示为:其中, 表示超图关联矩阵的拼接操作,H′ s 表示标签统计超图关联矩阵,H k 表示标签知识超图关联矩阵。
5.根据权利要求1所述的基于超图的标签聚类方法,其特征在于,卷积运算:其中,D v 表示顶点的度矩阵,D e 表示超边的度矩阵,W表示n条超边的权重矩阵,初始值为单位矩阵,X表示顶点的初始特征,Y表示经过超图卷积操作后得到的新特征。
6.根据权利要求1所述的基于超图的标签聚类方法,其特征在于,所述聚类算法采用AffinityPropagation聚类算法。