有效
基于混淆矩阵的文本分类方法、装置和计算机设备
孙建彬、姚雪湄、杨克巍、李自拓、蒋平、唐帅文、崔瑞靖、徐博浩、涂莉
中国人民解放军国防科技大学
孙
孙建彬 专利 38
中国人民解放军国防科技大学计算技术物理仪器模式识别
姚
姚雪湄 专利 6
中国人民解放军国防科技大学计算技术物理仪器电子数据处理
杨
杨克巍 专利 85
中国人民解放军国防科技大学行政管理商务信息处理计算技术
李
李自拓 专利 4
中国人民解放军国防科技大学计算技术物理仪器视觉识别
蒋
蒋平 专利 17
中国人民解放军国防科学技术大学电子数据处理计算技术物理仪器
唐
唐帅文 专利 29
中国人民解放军火箭军工程大学知识系统计算技术物理仪器
崔
崔瑞靖 专利 8
中国人民解放军国防科技大学计算技术物理仪器计算模型系统
徐
徐博浩 专利 5
重庆邮电大学物理仪器电子数据处理计算技术
涂
涂莉 专利 5
中国人民解放军国防科技大学计算技术物理仪器电子数据处理
摘要
本申请涉及一种基于混淆矩阵的文本分类方法、装置和计算机设备,首先获取候选分类算法受到攻击前的混淆矩阵,并在混淆矩阵的基础上,引入基于相同真实标签的预测正确和预测错误之间的质心,然后形成质心偏移四边形,并计算受到攻击前的混淆矩阵中的质心偏移四边形的总面积;接着采用攻击算法对各个候选分类算法进行攻击,并得到候选分类算法受到攻击后的混淆矩阵,同理,构建质心偏移四边形,采用本方法通过计算质心偏移四边形受到攻击前后的总面积差值能直观地看出候选分类算法对抗鲁棒性的差异,能够科学且快速地筛选出对抗鲁棒性最佳的分类算法进行文本分类,保证文本分类效果的稳定性。
1.一种基于混淆矩阵的文本分类方法,其特征在于,所述方法包括:获取评估文本样本集;所述评估文本样本集中的评估文本样本均有对应的真实分类标签;分别采用多种文本分类算法对所述评估文本样本集进行预测分类,基于预测分类的结果得到每一文本分类算法对应的第一混淆矩阵,并计算所述第一混淆矩阵中多个质心偏移四边形的第一总面积,根据第一总面积的大小从多种文本分类算法中筛选出预设数量的候选文本分类算法;在混淆矩阵中,每一方格的中心点的横坐标为评估文本样本的真实分类标签,纵坐标为评估文本样本的预测分类标签;每一方格的中心点的权重为对应方格中的评估文本样本量;所述评估文本样本量是通过将原始预测分类标签的置信度置为1得到的;质心偏移四边形的数量为 个,N表示分类标签的数量;其中,计算质心偏移四边形的面积的步骤包括:根据混淆矩阵中任意两个真实分类标签以及与其坐标值相同的两个预测分类标签所对应的方格确定当前的质心偏移四边形的构建区域,在所述构建区域内,根据两个真实分类标签分别确定两个偏移质心的横坐标,根据每一真实分类标签及其对应的两个预测分类标签所对应的两个方格的中心点的纵坐标和权重分别确定两个偏移质心的纵坐标,根据偏移质心的横坐标和纵坐标分别确定两个偏移质心的位置,根据两个偏移质心以及两个预测分类正确对应的方格的中心点,得到质心偏移四边形的区域,并计算得到所述质心偏移四边形的面积;采用预先选定的攻击算法在每一种候选文本分类算法对所述评估文本样本集进行预测分类的过程中加入欺骗文本样本,得到每一候选文本分类算法对应的第二混淆矩阵,并计算所述第二混淆矩阵中多个质心偏移四边形的第二总面积;根据质心偏移四边形的第一总面积和第二总面积的差值比较各个候选文本分类算法的对抗鲁棒性;将对抗鲁棒性最佳的候选文本分类算法嵌入至智能化设备进行目标文本分类。
2.根据权利要求1所述的方法,其特征在于,在所述第一混淆矩阵中,构建质心偏移四边形的步骤包括:根据第一混淆矩阵中任意两个真实分类标签以及与其坐标值相同的两个预测分类标签所对应的方格的中心点的连线确定当前的质心偏移四边形的构建区域;在所述构建区域内:将两个方格的中心点的横坐标分别作为两个偏移质心的横坐标: ; ;其中, 表示真实分类标签为 的偏移质心 的横坐标, 表示真实分类标签为 的方格的中心点的横坐标, 表示真实分类标签为 的偏移质心 的横坐标, 表示真实分类标签为 的方格的中心点的横坐标;将方格中的评估文本样本量作为对应方格的中心点的权重;根据每一真实分类标签及其对应的两个预测分类标签所对应的两个方格的中心点的纵坐标和权重分别确定两个偏移质心的纵坐标: ; ;其中, 表示真实分类标签为 的偏移质心 的纵坐标, 表示真实分类标签为 的偏移质心 的纵坐标, 表示真实分类标签为 的方格的中心点的纵坐标, 表示真实分类标签为 的方格的中心点的纵坐标, 表示真实分类标签为 ,预测分类标签为 的方格中的评估文本样本量, 表示真实分类标签为 ,预测分类标签为 的方格中的评估文本样本量, 表示真实分类标签为 ,预测分类标签也为 的方格中的评估文本样本量, 表示真实分类标签为 ,预测分类标签也为 的方格中的评估文本样本量;根据偏移质心的两个横坐标和两个纵坐标得到构建质心偏移四边形。
3.根据权利要求2所述的方法,其特征在于,计算所述第一混淆矩阵中多个质心偏移四边形的第一总面积,包括:计算所述第一混淆矩阵中多个质心偏移四边形的第一总面积为: ;其中, 表示真实分类标签分别为 , ,预测分类标签也分别为 , 的4个方格中的质心偏移四边形的第一面积, 表示质心偏移四边形对应的四个方格的中心点构成的四边形的面积。
4.根据权利要求3所述的方法,其特征在于,在所述第二混淆矩阵中,构建质心偏移四边形的步骤包括:根据第一混淆矩阵中任意两个真实分类标签以及与其坐标值相同的两个预测分类标签所对应的方格的中心点的连线确定当前的质心偏移四边形的构建区域;在所述构建区域内:将两个方格的中心点的横坐标分别作为两个偏移质心的横坐标: ; ;其中, 表示真实分类标签为 的偏移质心 的横坐标, 表示真实分类标签为 的偏移质心 的横坐标;将方格中的评估文本样本量作为对应方格的中心点的权重;在第二混淆矩阵中,方格中的评估文本样本量是通过第一混淆矩阵中对应方格的评估文本样本量,以及相对第一混淆矩阵中预测分类标签发生变化的评估文本样本转移量计算得到的;根据每一真实分类标签及其对应的两个预测分类标签所对应的两个方格的中心点的纵坐标和权重分别确定两个偏移质心的纵坐标: ; ;其中, 表示真实分类标签为 的偏移质心 的纵坐标, 表示真实分类标签为 的偏移质心 的纵坐标, 表示真实分类标签为 的预测分类标签从 变为 的评估文本样本转移量, 表示真实分类标签为 的预测分类标签从 变为 的评估文本样本转移量;根据偏移质心的两个横坐标和两个纵坐标构建得到质心偏移四边形。
5.根据权利要求4所述的方法,其特征在于,计算所述第二混淆矩阵中多个质心偏移四边形的第二总面积,包括:计算所述第二混淆矩阵中多个质心偏移四边形的第二总面积为: ;其中, 表示真实分类标签分别为 , ,预测分类标签也分别为 , 的4个方格中的质心偏移四边形的第二面积。
6.根据权利要求5所述的方法,其特征在于,根据质心偏移四边形的第一总面积和第二总面积的差值比较各个候选文本分类算法的对抗鲁棒性,包括:根据质心偏移四边形的第一总面积和第二总面积的差值比较各个候选文本分类算法的对抗鲁棒性为: ;其中,差值越小,代表对抗鲁棒性越好。
7.据权利要求5所述的方法,其特征在于,将对抗鲁棒性最佳的候选分类算法嵌入至智能化设备进行目标文本分类,包括:将质心偏移四边形的第一总面积和第二总面积的差值最小的候选分类算法嵌入至智能化设备进行目标文本分类。
8.一种基于混淆矩阵的文本分类装置,其特征在于,所述装置包括:评估文本样本集获取模块,用于获取评估文本样本集;所述评估文本样本集中的评估文本样本均有对应的真实分类标签;第一总面积计算模块,用于分别采用多种文本分类算法对所述评估文本样本集进行预测分类,基于预测分类的结果得到每一文本分类算法对应的第一混淆矩阵,并计算所述第一混淆矩阵中多个质心偏移四边形的第一总面积,根据第一总面积的大小从多种文本分类算法中筛选出预设数量的候选文本分类算法;在混淆矩阵中,每一方格的中心点的横坐标为评估文本样本的真实分类标签,纵坐标为评估文本样本的预测分类标签;每一方格的中心点的权重为对应方格中的评估文本样本量;所述评估文本样本量是通过将原始预测分类标签的置信度置为1得到的;质心偏移四边形的数量为 个,N表示分类标签的数量;其中,计算质心偏移四边形的面积的步骤包括:根据混淆矩阵中任意两个真实分类标签以及与其坐标值相同的两个预测分类标签所对应的方格确定当前的质心偏移四边形的构建区域,在所述构建区域内,根据两个真实分类标签分别确定两个偏移质心的横坐标,根据每一真实分类标签及其对应的两个预测分类标签所对应的两个方格的中心点的纵坐标和权重分别确定两个偏移质心的纵坐标,根据偏移质心的横坐标和纵坐标分别确定两个偏移质心的位置,根据两个偏移质心以及两个预测分类正确对应的方格的中心点,得到质心偏移四边形的区域,并计算得到所述质心偏移四边形的面积;第二总面积计算模块,用于采用预先选定的攻击算法在每一种候选文本分类算法对所述评估文本样本集进行预测分类的过程中加入欺骗文本样本,得到每一候选文本分类算法对应的第二混淆矩阵,并计算所述第二混淆矩阵中多个质心偏移四边形的第二总面积;对抗鲁棒性比较模块,用于根据质心偏移四边形的第一总面积和第二总面积的差值比较各个候选文本分类算法的对抗鲁棒性;目标文本分类模块,用于将对抗鲁棒性最佳的候选文本分类算法嵌入至智能化设备进行目标文本分类。
9.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至7中任一项所述方法的步骤。



