有效
一种模型鲁棒性与攻击有效性的测量评估与分数计算方法
郑军、孙家正、熊雯琦、黄蓉、夏晨笑
北京理工大学
郑
郑军机构 暂无
技术领域 暂无
孙
孙家正机构 暂无
技术领域 暂无
熊
熊雯琦机构 暂无
技术领域 暂无
黄
黄蓉机构 暂无
技术领域 暂无
夏
夏晨笑机构 暂无
技术领域 暂无
摘要
本发明涉及一种模型鲁棒性与攻击有效性的测量评估与分数计算方法,包括:建立由模型能力评估指标、攻击效果评估指标、攻击代价评估指标组成的评估指标体系;对所述评估体系中评估指标进行评估;以及基于项目反应理论以及马尔科夫链蒙特卡洛方法进行分数计算。本发明一种模型鲁棒性与攻击有效性的测量评估与分数计算方法能够直观且综合地反映出评估目标性能以及不同模型或是攻击算法间的性能差异,而且可以用于多种不同结构模型以及不同种类对抗攻击算法的性能评估,具有普适性与灵活性。
1.一种模型鲁棒性与攻击有效性的测量评估与分数计算方法,其特征在于,所述方法包括:步骤1,建立由模型能力评估指标、攻击效果评估指标、攻击代价评估指标组成的评估指标体系;所述模型能力评估指标包括干净样本正确率(C11)、干净样本F1分数(C12)、干净样本平均正确分类置信度(13);所述攻击效果评估指标包括对抗样本误分类比例(C21)、攻击准确性C22)、对抗样本平均置信变化(C23)、对抗样本模型关注区域偏移(C24)、对抗样本可观测转移率(C25);所述攻击代价评估指标包括攻击耗时代价(C31)、攻击查询量代价(C32)、平均范数失真(C33)、平均频域欧式距离(C34)、平均特征相似性(C35);步骤2,对所述评估指标体系中的评估指标进行评估;对所述评估指标体系中的评估指标进行评估的步骤包括S11、针对若干模型、攻击方法,对它们进行交叉组合,分别采集并计算每一组模型-攻击方法的评估指标,形成数据矩阵;S12、依据任务目标,沿攻击方法或模型的改变方向叠加并平均S11获得的数据矩阵,使其掩蔽因不同模型或因不同攻击方法而带来的差异,获得一般性评估指标数据;S13、对所述S12产生的一般性评估指标数据进行映射和归一化处理,得到处理后适用于分数计算的评估指标;S14、对所述S13处理后的评估指标,使用基于项目反应理论以及马尔科夫链蒙特卡洛方法的综合能力计算方法对评估目标的能力分数进行计算;S15、根据前述评估方法计算得出的评估目标的能力分数,对其进行分析与评价;步骤3,基于项目反应理论以及马尔科夫链蒙特卡洛方法进行分数计算所述基于项目反应理论以及马尔科夫链蒙特卡洛方法进行分数计算,包括以下步骤,设:θ i 表示第i个被试者的能力,a j 表示第j个测试项目的区分度,β j 表示第j个测试项目的难度,c j 表示第j个测试项目的猜测参数,N表示被试者数量,m表示测试项目数量,X i=1→N,j=1→m 表示被试分数矩阵,L表示迭代步数,M表示收敛步数,这里使用被试者指代评估目标,即模型或是对抗攻击算法;根据实验为参数N、m、L、M设定初始值,并使用所述S14中获得的处理后评估指标构建被试分数矩阵X i=1→N,j=1→m ;对于参数θ、a、β、c任意选取一个初始值 初始参数设定完成后,开始执行循环,直至迭代步数完成;得到样本集合 计算得到被试者能力分数 以及项目参数 所述“初始参数设定完成后,开始执行循环,直至迭代步数完成”包括:随机抽取一个候选状态值:对各个被试者(i=1,2,…,N)进行采样 计算接受概率: 从均匀分布采样u~Uniform[0,1],若 则接受转移:并令 否则拒绝转移,并令 对各项目参数(j=1,2,…,m)进行采样 计算接受概率: 从均匀分布采样u~Uniform[0,1],如果采样点满足 则接受转移,并令 否则拒绝转移,并令
2.根据权利要求1所述的一种模型鲁棒性与攻击有效性的测量评估与分数计算方法,其特征在于:所述干净样本正确率(C11)指标表示模型对干净数据集分类的正确率情况,可表示为 其中,F(x i )表示分类模型f对原始图像x i 进行预测得出的结果标签值,y i 表示原始图像x i 的真实标签;所述干净样本F1分数(C12)指标表示模型对干净数据集分类的F1分数,可表示为 其中,召回率表示为 准确率表示为 其中 所述干净样本平均正确分类置信度(C13)指标表示模型对干净数据集分类时正确类别上的平均置信度,可表示为 其中,P(x i )表示分类模型f对原始图像x i 进行推理得到的置信度矩阵;所述对抗样本误分类比例(C21)指标表示攻击后被错分类为与攻击前不同的任意其他类别的图片数量占比,可表示为: 其中, 表示原始图像x i 受到a攻击后生成的对抗样本, 表示分类模型f对对抗样本 进行推理得到的标签,y i 表示原始图像x i 的真实标签;所述攻击准确性指标(C22)用于定向攻击中辅助衡量定向攻击效果,可表示为: 其中, 表示定向攻击目标标签;所述对抗样本置信偏移指标(C23)用于反映攻击前后模型预测的置信度改变量,进而衡量攻击对模型识别结果的偏转程度,由对抗类平均置信增高和真实类平均置度降低两个子指标组成,分别揭示了攻击在多大程度上欺骗分类器将被攻击图片分类为对抗类别或使其偏离真实的类别,可分别表示为: 和 其中, 表示分类模型f对对抗样本 进行推理得到的标签,P(x i )表示分类模型f对原始图像x i 进行推理得到的置信度矩阵,P(x i )函数下标表示取该类的置信度值;所述对抗样本模型关注区域偏移(C24)指标通过计算攻击前后模型关注区域的余弦相似度,分析攻击是否使得模型关注到错误的特征或者信息,由攻击前后模型预测结果类对应区域的偏移和攻击前后原始标签类对应区域的偏移两个子指标组成,可分别表示为: 和 其中, 表示样本推理时模型对类别关注区域,可表示为 A k 表示A中通道k的数据,A取最后一个卷积层输出的特征层, 为权重,可表示为 P c 为类别c的预测分数, 为A中通道k中ij处的数据,Z为A的面积,S(a,b)为a与b的余弦相似度;所述对抗样本可观测转移率指标(C25)用于反映攻击针对特定目标模型生成的对抗样本被其他模型误分类的比例,可表示为: 其中,m为被测标准模型数量,A(F,x)→x a 为对抗样本x a 由原始图片x经由攻击算法A基于模型F生成;所述攻击耗时代价指标(C31)用于反映攻击方法生成一张对抗样本的耗时情况;所述攻击查询量代价(C32))指标用于反映攻击方法生成一张对抗样本的平均模型查询量情况,包括攻击过程中模型的Forward运算和攻击过程中模型的Backward运算;所述平均范数距离失真(C33)表示攻击前后图像的范数距离,由平均最大像素距离、平均欧式距离、平均像素变化比例三个子指标组成;所述平均频域欧式距离(C34)指标表示攻击前后图像经过频域差分后高频与低频分量的平均欧式距离,由低频分量重建图像的欧氏距离和高频分量重建图像的欧氏距离两个子指标组成;所述平均特征相似性(C35)指标表示攻击前后图像色彩、结构、纹理等特征的偏移程度平,由平均深度特征相似性和平均低层特征相似性两个子指标组成。
3.根据权利要求2所述的一种模型鲁棒性与攻击有效性的测量评估与分数计算方法,其特征在于:所述平均最大像素距离为对抗样本相对于原始图片所修改的像素最大偏离值,常作为攻击方法的扰动限制条件,可表示为: 其中||·|| ∞ 表示无穷范数,用于计算图片中像素最大偏离值;所述平均欧式距离为原始图片和对抗样本之间的欧氏距离,可表示为: 其中||·|| 2 表示欧式范数用于计算欧氏距离,||·|| 0 表示0范数,用于计算向量中非零元素的个数;所述平均像素变化比例为对抗样本相对于原始图片所修改的像素个数,可表示为: 所述低频分量重建图像的欧氏距离可表示为 所述高频分量重建图像的欧氏距离可表示为 其中,φ ll (x)=L T (LxL T )L,φ lh+hl+hh (x)=L T (LxH T )H+H T (HxL T )L+H T (HxL T )L,L和H分别为正交小波的低通滤波器和高通滤波器;所述平均深度特征相似性为所有攻击成功的对抗样本的多尺度梯度幅度相似性偏差,可表示为 其中: 其中σ j (x,y)为第j尺度上的GMSD得分,ω j 为不同尺度的权值;所述平均低层特征相似性为所有攻击成功的对抗样本的深度图像结构和纹理相似性,可表示为 其中: 其中: 为纹理相似度量,可表示为 为结构相似度量,可表示为 {a ij ,β ij }为可学习权值,且满足 其中: 分别表示 和 的全局平均, 表示 和 的方差, 表示 和 的全局协方差,c 1 和c 2 偏置量。



