有效
基于语义的真假性特征的多模态虚假新闻检测方法及装置
李东升、彭丽雯、蹇松雷、乔林波、黄辰林、阚志刚
中国人民解放军国防科技大学
摘要
本发明公开一种基于语义的真假性特征的多模态虚假新闻检测方法及装置,该方法步骤包括:获取目标任务数据集中新闻的文本模态数据和对应的图像模态数据;对模态数据进行特征提取,得到单模态特征;对单模态特征分别进行聚类,得到语义伪标签;分别提取单模态特征的语义特征后进行学习,得到学习好的语义特征;提取单模态特征的真假特征;根据语义特征以及真假特征得到基于语义的真假性特征;融合文本模态、图像模态中基于语义的真假性特征得到新闻的多模态特征;训练虚假新闻检测网络;将所有新闻根据语义伪标签划分为多个簇,每一个簇使用对应的分类器实现簇内新闻的真假分类。本发明具有实现方法简单、实现成本低、检测效率以及精度等优点。
1.一种基于语义的真假性特征的多模态虚假新闻检测方法,其特征在于,步骤包括:步骤1:获取目标任务数据集中新闻的文本模态数据和对应的图像模态数据;步骤2:对获取的所述新闻的文本模态数据和对应的图像模态数据进行特征提取,得到新闻的文本单模态特征和图像单模态特征;步骤3:对目标数据集中所有新闻的所述文本单模态特征和图像单模态特征分别进行聚类,得到所有新闻的文本语义伪标签和图像语义伪标签;步骤4:分别提取所述文本单模态特征、图像单模态特征的语义特征,并基于所述新闻的文本语义伪标签和图像语义伪标签对提取的语义特征进行学习,得到学习好的新闻的文本模态语义特征以及图像模态语义特征;步骤5:提取所述文本单模态特征、图像单模态特征的真假特征,分别得到新闻的文本模态真假特征以及图像模态真假特征;步骤6:根据所述新闻的文本模态语义特征、图像模态语义特征以及所述新闻的文本模态真假特征、图像模态真假特征,分别得到新闻的文本模态与图像模态的基于语义的真假性特征;步骤7:融合新闻的文本模态中所述基于语义的真假性特征、图像模态中所述基于语义的真假性特征得到新闻的多模态特征;步骤8:根据新闻的多模态特征构建网络训练的损失函数,并从目标任务数据集中选取出训练数据进行虚假新闻检测网络训练,训练完成后得到训练好的所有新闻的多模态特征;步骤9:将所有新闻的多模态特征根据语义伪标签划分为多个簇,每一个簇使用对应的分类器实现簇内新闻的真假分类;所述步骤8包括:对新闻的所述多模态特征,根据步骤S3得到的新闻的文本语义伪标签,分别构建基于语义的真假性损失函数以及基于语义的簇内距离损失函数,所述基于语义的真假性损失函数用于区分不同语义下的真假新闻,所述基于语义的簇内距离损失函数用于加强相同语义下的新闻语义特征,以及构建一个全连接层的神经网络用于预测新闻的真假标签,使用交叉熵损失进行网络训练,得到所述虚假新闻检测网络。
2.根据权利要求1所述的基于语义的真假性特征的多模态虚假新闻检测方法,其特征在于,所述步骤4中,通过使用三元组学习对提取的语义特征进行学习,所述使用三元组学习时,基于所述新闻的文本语义伪标签和图像语义伪标签构造三元组学习的损失函数,并将各三元组根据目标样本和正负样本之间的距离d进行分组,从分组结果中选取出三元组数据进行网络训练,训练后得到学习好的新闻的文本模态语义特征以及图像模态语义特征。
3.根据权利要求2所述的基于语义的真假性特征的多模态虚假新闻检测方法,其特征在于,所述使用三元组学习对提取的语义特征进行学习的步骤包括:步骤401.从目标数据集中选择一个新闻作为目标样本以及采样一个正样本、负样本构建三元组,正样本和目标样本拥有相同的语义伪标签,负样本和目标样本的语义伪标签不同;步骤402.根据目标样本与正样本的距离d1以及目标样本与负样本之间的距离d2,计算每个三元组中目标样本和正负样本之间的距离d;步骤403.根据目标样本和正负样本之间的距离d将目标数据集中各三元组划分为简单三元组、半难三元组以及最难三元组,所述简单三元组、半难三元组以及最难三元组对应的目标样本和正负样本之间的距离d依次减小;步骤404.使用所述半难三元组、所述最难三元组训练语义特征提取网络,其中先使用所述半难三元组进行多次的预训练,再使用所述最难三元组执行网络训练,训练完成后得到学习好的新闻的语义特征。
4.根据权利要求1所述的基于语义的真假性特征的多模态虚假新闻检测方法,其特征在于,所述步骤6的具体步骤包括:步骤601.基于新闻的文本模态、图像模态的语义伪标签,将新闻的文本模态、图像模态的语义特征使用注意力机制进行加权,得到加权后的文本模态、图像模态语义特征;步骤602.根据步骤5得到的新闻的文本模态、图像模态的真假特征以及所述加权后的文本模态、图像模态语义特征,使用基于语义的真假性特征提取网络,得到新闻的文本模态、图像模态对应的基于语义的真假性特征。
5.根据权利要求4所述的基于语义的真假性特征的多模态虚假新闻检测方法,其特征在于,所述步骤601中,按照下式计算新闻 s i 的加权后的语义特征 H i :其中, N oi 是和新闻 s i 拥有同样语义伪标签的新闻内容集合, 为衡量集合中不同数据的重要程度的参数, h j 为新闻 s j 的语义特征,计算公式为:其中, h k 为新闻 s k 的语义特征,Score( h i , h j )用于计算新闻 s i 和 s j 的语义特征的相关性,公式如下:其中, v 1 和 W 1 分别是需要学习的神经网络参数。
6.根据权利要求1所述的基于语义的真假性特征的多模态虚假新闻检测方法,其特征在于,所述步骤6中使用GRU计算得到基于语义的真假性特征,和/或步骤7中使用GRU融合文本模态、图像模态中基于语义的真假性特征得到新闻的多模态特征,所述使用GRU计算得到基于语义的真假性特征包括将新闻的文本模态、图像模态的真假特征作为GRU网络的输入数据,将新闻的文本模态、图像模态的语义特征使用注意力机制进行加权后的文本模态、图像模态语义特征作为GRU网络的隐藏层数据,由所述GRU网络的输出数据得到所述新闻的文本模态、图像模态对应的基于语义的真假性特征;所述使用GRU融合文本模态、图像模态中基于语义的真假性特征得到新闻的多模态特征包括:将新闻的文本模态中基于语义的真假性特征作为GRU网络的输入数据,将新闻的图像模态中基于语义的真假性特征作为GRU网络的隐藏层数据,由GRU网络的输出数据得到新闻的所述多模态特征。
7.根据权利要求1所述的基于语义的真假性特征的多模态虚假新闻检测方法,其特征在于,所述构建基于语义的真假性损失函数包括:步骤801.将所有新闻根据语义伪标签划分为多个簇,每个簇中包含相同语义的新闻,不同语义的新闻在不同的簇中;步骤802.在每个簇内采样三元组,并根据目标样本和正负样本之间的距离d将采样的各三元组划分为简单三元组、半难三元组以及最难三元组,所述简单三元组、半难三元组以及最难三元组对应的目标样本和正负样本之间的距离d依次减小;步骤803.使用所有簇内采样出的所述半难三元组和所述最难三元组作为训练数据,计算基于语义的真假性三元组学习损失函数。
8.根据权利要求1所述的基于语义的真假性特征的多模态虚假新闻检测方法,其特征在于,通过将所有新闻根据语义伪标签划分为多个簇,每个簇中包含相同语义的新闻,不同语义的新闻在不同的簇中;计算每个簇内任意两个数据点之间的距离并计算簇内平均距离,将所有簇的簇内平均距离相加得到所述基于语义的簇内距离损失函数。
9.一种基于语义的真假性特征的多模态虚假新闻检测装置,其特征在于,包括:获取模块,用于获取目标任务数据集中新闻的文本模态数据和对应的图像模态数据;单模态特征提取模块,用于对获取的所述新闻的文本模态数据和对应的图像模态数据进行特征提取,得到新闻的文本单模态特征和图像单模态特征;聚类模块,用于对目标数据集中所有新闻的所述文本单模态特征和图像单模态特征分别进行聚类,得到所有新闻的文本语义伪标签和图像语义伪标签;语义特征提取模块,用于分别提取所述文本单模态特征、图像单模态特征的语义特征,并基于所述新闻的文本语义伪标签和图像语义伪标签对提取的语义特征进行学习,得到学习好的新闻的文本模态语义特征以及图像模态语义特征;真假特征提取模块,用于提取所述文本单模态特征、图像单模态特征的真假特征,分别得到新闻的文本模态真假特征以及图像模态真假特征;融合语义和真假性特征模块,用于根据所述新闻的文本模态语义特征、图像模态语义特征以及所述新闻的文本模态真假特征、图像模态真假特征,分别得到新闻的文本模态与图像模态的基于语义的真假性特征;多模态特征融合模块,用于融合新闻的文本模态中所述基于语义的真假性特征、图像模态中所述基于语义的真假性特征得到新闻的多模态特征;检测网络训练模块,用于根据新闻的多模态特征构建网络训练的损失函数,并从目标任务数据集中选取出训练数据进行虚假新闻检测网络训练,训练完成后得到训练好的所有新闻的多模态特征;真假分类模块,用于将所有新闻的多模态特征根据语义伪标签划分为多个簇,每一个簇使用对应的分类器实现簇内新闻的真假分类;所述检测网络训练模块包括:对新闻的所述多模态特征,根据聚类模块得到的新闻的文本语义伪标签,分别构建基于语义的真假性损失函数以及基于语义的簇内距离损失函数,所述基于语义的真假性损失函数用于区分不同语义下的真假新闻,所述基于语义的簇内距离损失函数用于加强相同语义下的新闻语义特征,以及构建一个全连接层的神经网络用于预测新闻的真假标签,使用交叉熵损失进行网络训练,得到所述虚假新闻检测网络;或所述基于语义的真假性特征的多模态虚假新闻检测装置,包括处理器以及存储器,所述存储器用于存储计算机程序,其特征在于,所述处理器用于执行所述计算机程序以执行如权利要求1~8中任意一项所述方法。
暂无引用专利



