有效
基于多层次数据表示学习的用户身份信息识别方法和装置
赵涛、邓劲生、严少洁、宋省身、乔凤才、尹晓晴
中国人民解放军国防科技大学
摘要
本申请涉及一种基于多层次数据表示学习的用户身份信息识别方法和装置。所述方法包括:通过获取社交媒体平台的发布信息数据和用户个人信息数据,进行过滤清洗预处理后,进行特征提取,然后通过数据表示算法对发布信息第一特征、发布信息第二特征、用户第一特征和用户第二特征进行表示学习,分别得到特征表示;通过构建用户表示模型,先根据发布信息的文本向量表示、发布信息第一特征和发布信息第二特征得到发布信息表示,再根据得到的发布信息表示,以及之前的用户第一特征表示和用户第二特征表示,得到用户表示,最后通过分类器根据用户表示进行用户身份信息预测;对用户表示模型进行训练,训练完成后用于基于社交平台数据的用户身份信息识别。
1.一种基于多层次数据表示学习的用户身份信息识别方法,其特征在于,所述方法包括:获取社交媒体平台的发布信息数据和用户个人信息数据,对所述用户个人信息数据进行过滤清洗,对所述发布信息数据进行预处理,并根据预处理后的发布信息数据建立语料库;根据所述预处理后的发布信息数据得到每条发布信息的发布信息第一特征和发布信息第二特征,根据过滤后的用户个人信息数据得到每个用户的用户第一特征和用户第二特征;所述发布信息第一特征为所述发布信息引起的互动数量的数值型信息;所述发布信息第二特征为所述发布信息的类别信息;所述用户第一特征为关于用户级别的数值型信息;所述用户第二特征为所述用户的类别型信息;根据所述语料库得到发布信息对应的文本向量表示,通过数据表示算法对所述发布信息第一特征、所述发布信息第二特征、所述用户第一特征和所述用户第二特征进行表示学习,分别得到发布信息第一特征表示、发布信息第二特征表示、用户第一特征表示和用户第二特征表示;将所述文本向量表示、所述发布信息第一特征表示、所述发布信息第二特征表示、所述用户第一特征表示和所述用户第二特征表示输入到预先设计的用户表示模型中;所述用户表示模型包括发布信息表示层、用户表示层和输出层;所述发布信息表示层用于根据所述文本向量表示、所述发布信息第一特征表示和所述发布信息第二特征表示得到发布信息表示;所述用户表示层用于根据所述发布信息表示、所述用户第一特征表示和所述用户第二特征表示得到用户表示;所述输出层用于根据所述用户表示得到用户身份信息识别结果;根据预设的损失函数对所述用户表示模型进行训练,得到训练好的用户表示模型,通过所述训练好的用户表示模型进行用户身份信息识别。
2.根据权利要求1所述的方法,其特征在于,获取社交媒体平台的发布信息数据和用户个人信息数据,对所述用户个人信息数据进行过滤,对所述发布信息数据进行预处理,并根据预处理后的发布信息数据建立语料库,包括:获取社交媒体平台的发布信息数据和用户个人信息数据;从所述用户个人信息数据中删除噪声用户的数据以及不活跃用户的数据;根据所述发布信息数据和中文维基百科的文本数据集建立中文数据语料库;对所述中文数据语料库进行分词以建立语料库。
3.根据权利要求2所述的方法,其特征在于,根据所述语料库得到发布信息对应的文本向量表示,包括:基于所述语料库预训练Word2Vec模型;使用训练好的Word2Vec模型将每一条发布信息数据中的文本单词转换成单词嵌入向量,得到发布信息对应的文本向量表示。
4.根据权利要求3所述的方法,其特征在于,通过数据表示算法对所述发布信息第一特征、所述发布信息第二特征、所述用户第一特征和所述用户第二特征进行表示学习,分别得到发布信息第一特征表示、发布信息第二特征表示、用户第一特征表示和用户第二特征表示,包括:通过耦合表示算法对所述发布信息第一特征和所述用户第一特征进行表示学习,分别得到发布信息第一特征表示和用户第一特征表示;通过基于层次值耦合关系学习的数据表示算法对所述发布信息第二特征和所述用户第二特征进行表示学习,分别得到发布信息第二特征表示和用户第二特征表示。
5.根据权利要求4所述的方法,其特征在于,所述耦合表示算法的步骤包括:获取输入的数值型的原始特征 其中,s 1 为所述原始特征中包括的特征数;将所述原始特征 通过按幂展开的方式映射到考虑线性和非线性信息的扩展空间:其中, 表示特征 的p次幂;根据特征 与其自身的幂 定义原始特征 的内部耦合关系矩阵 定义特征 和其它特征 之间的耦合关系矩阵 根据特征 内部耦合关系和特征间的耦合关系,将特征 表示为一个1×L的向量表示:其中,w=[1/(1!),1/(2!),…,1/(L!)],⊙表示哈达玛积, 表示矩阵乘法, 为特征 的值及其幂的表示向量, 为其他特征 的值及其幂的表示向量;进而得到所述原始特征空间 的耦合数据表示为:
6.根据权利要求5所述的方法,其特征在于,所述基于层次值耦合关系学习的数据表示算法的步骤包括:获取输入的类别型的原始特征空间 其中,s 2 为所述原始特征中包括的特征数,特征 的所有可能的类别集合表示为V i ,所有类别型特征的所有可能的类别集合 其中 即 构建基于出现的特征值影响矩阵M o ;构建基于共同出现的特征值影响矩阵M c ;分别使用不同的k∈{k 1 ,k 2 ,…,k o }对矩阵M o 进行k-means聚类,得出一个簇标志矩阵;分别使用不同的k∈{k 1 ,k 2 ,…,k c }对矩阵M c 进行k-means聚类,得出另一个簇标志矩阵;将两个簇标志矩阵合并得到一个 的标志矩阵I;采用主成分分析技术对所述标志矩阵I进行特征值簇之间的线性关系学习,得到特征值表示矩阵N;根据所述特征值表示矩阵,得到原始特征空间 的耦合数据表示:
7.根据权利要求6所述的方法,其特征在于,根据所述文本向量表示、所述发布信息第一特征表示和所述发布信息第二特征表示得到发布信息表示,包括:获取所述文本向量表示 将所述文本向量表示输入进GRU层,并将得到的隐藏状态输入到平均池层,得到文本表示 通过一个全连接层将所述发布信息第一特征表示 转换成一个k na 维的表示 其中W na 和b na 是学习的参数;通过一个全连接层将所述发布信息第二特征表示 转换成一个k ca 维的表示 其中W ca 和b ca 是学习的参数;进一步得到第i条发布信息的发布信息表示 以及用户所有发布信息的发布信息表示
8.根据权利要求7所述的方法,其特征在于,根据所述发布信息表示、所述用户第一特征表示和所述用户第二特征表示得到用户表示,包括:获取所述用户所有发布信息的发布信息表示 将所述发布信息表示 输入到GRU层,并将得到的隐藏状态输入到平均池层,得到基于发布信息的表示u m =GRU(u);分别利用全相连层将所述用户第一特征表示和所述用户第二特征表示转换成相应的k nf 维的表示u nf 和k cf 维的表示u cf ;进一步得到用户表示u r =[u m ;u nf ;u cf ]。
9.根据权利要求8所述的方法,其特征在于,所述预设的损失函数为:其中, 表示类别c的概率,U代表训练的用户集,p c 是类别c的预测概率。
10.一种基于多层次数据表示学习的用户身份信息识别装置,其特征在于,所述装置包括:数据获取模块,用于获取社交媒体平台的发布信息数据和用户个人信息数据,对所述用户个人信息数据进行过滤清洗,对所述发布信息数据进行预处理,并根据预处理后的发布信息数据建立语料库;特征提取模块,用于根据所述预处理后的发布信息数据得到每条发布信息的发布信息第一特征和发布信息第二特征,根据过滤后的用户个人信息数据得到每个用户的用户第一特征和用户第二特征;所述发布信息第一特征为所述发布信息引起的互动数量的数值型信息;所述发布信息第二特征为所述发布信息的类别信息;所述用户第一特征为关于用户级别的数值型信息;所述用户第二特征为所述用户的类别型信息;数据表示学习模块,用于根据所述语料库得到发布信息对应的文本向量表示,通过数据表示算法对所述发布信息第一特征、所述发布信息第二特征、所述用户第一特征和所述用户第二特征进行表示学习,分别得到发布信息第一特征表示、发布信息第二特征表示、用户第一特征表示和用户第二特征表示;模型数据输入模块,用于将所述文本向量表示、所述发布信息第一特征表示、所述发布信息第二特征表示、所述用户第一特征表示和所述用户第二特征表示输入到预先设计的用户表示模型中;所述用户表示模型包括发布信息表示层、用户表示层和输出层;所述发布信息表示层用于根据所述文本向量表示、所述发布信息第一特征表示和所述发布信息第二特征表示得到发布信息表示;所述用户表示层用于根据所述发布信息表示、所述用户第一特征表示和所述用户第二特征表示得到用户表示;所述输出层用于根据所述用户表示得到用户身份信息识别结果;模型训练使用模块,用于根据预设的损失函数对所述用户表示模型进行训练,得到训练好的用户表示模型,通过所述训练好的用户表示模型进行用户身份信息识别。
暂无引用专利



