1.一种基于包长序列的加密网络流量分析方法,其特征是,包括:基于第一训练数据集对待训练PS-LM模型进行预训练,得到PS-LM模型,所述PS-LM模型包括依次连接的分词嵌入模块和PS-LM模块,所述分词嵌入模块用于对网络流进行处理,得到所述网络流对应的词元序列的嵌入,所述PS-LM模块用于对所述词元序列的嵌入进行处理,得到所述词元序列中每个词元的输出向量;基于第二训练数据集对网络流量分析模型进行有监督微调,得到训练好的网络流量分析模型,所述网络流量分析模型包括所述PS-LM模型和分类头,所述分类头用于执行下游任务对应的分类处理;基于所述训练好的网络流量分析模型对待处理网络流进行分析,得到分析结果;其中,所述基于所述训练好的网络流量分析模型对待处理网络流进行分析,得到分析结果,包括:基于扰动样本落入不同类别区域的概率计算样本鲁棒性;基于噪声扰动下所述训练好的网络流量分析模型在测试集上识别结果的分布情况计算模型鲁棒性;在所述样本鲁棒性和所述模型鲁棒性满足预设条件时,基于所述训练好的网络流量分析模型对待处理网络流进行分析,得到分析结果;其中,所述基于扰动样本落入不同类别区域的概率计算样本鲁棒性,包括:将所述扰动样本落入第一类别区域的概率确定为第一概率,将所述扰动样本落入第二类别区域的概率确定为第二概率,所述第一类别区域为置信概率最大的类别区域,所述第二类别区域为置信概率第二大的类别区域;利用二项式比例置信区间计算所述第一概率的下界和所述第二概率的上界;基于所述第一概率的下界和所述第二概率的上界的差值确定所述样本鲁棒性;其中,所述模型鲁棒性 为: ;其中, 基于PA曲线确定: ;其中, 为指示函数, 为第 个样本的标签, 为第 个样本由所述第一概率确定的标签, 且 , 为样本的数量, 为所述PA曲线中的坐标值, 为逻辑与, 为第 个样本对应的第一概率的下界, 为第 个样本对应的第二概率的上界。
2.如权利要求1所述的方法,其特征是,所述基于所述训练好的网络流量分析模型对待处理网络流进行分析,得到分析结果,包括:基于所述分词嵌入模块获取所述待处理网络流对应的词元序列中每个词元的嵌入,所述词元序列的起始处添加有特殊标识;将所述词元序列中每个词元的嵌入输入所述PS-LM模块进行处理,得到所述词元序列中每个词元的输出向量,所述特殊标识的输出向量用于表征所述词元序列;将所述特殊标识的输出向量输入所述分类头进行下游任务对应的分类处理,得到分析结果。
3.如权利要求2所述的方法,其特征是,所述分词嵌入模块包括分词器和嵌入层,所述基于所述分词嵌入模块获取所述待处理网络流对应的词元序列中每个词元的嵌入,所述词元序列的起始处添加有特殊标识,包括:将所述待处理网络流输入所述分词器进行分词处理,并在序列的起始处添加所述特殊标识,得到基于包长值的所述词元序列;使用所述嵌入层对所述词元序列进行编码,得到所述词元序列中每个词元的嵌入,所述词元的嵌入包括所述词元的位置信息。
4.如权利要求1所述的方法,其特征是,所述第二训练数据集包括第一阶段数据集和第二阶段数据集,所述基于第二训练数据集对网络流量分析模型进行有监督微调,得到训练好的网络流量分析模型,包括:在所述PS-LM模型的所述PS-LM模块后连接所述分类头,得到所述网络流量分析模型;冻结所述网络流量分析模型中所述PS-LM模型的网络参数,基于所述第一阶段数据集对所述分类头进行梯度传播,得到第一阶段训练模型;解冻所述第一阶段训练模型中所述PS-LM模型的网络参数,基于所述第二阶段数据集对所述第一阶段训练模型进行全参数微调,得到所述训练好的网络流量分析模型。
5.一种基于包长序列的加密网络流量分析模型,其特征是,包括:预训练模块,用于基于第一训练数据集对待训练PS-LM模型进行预训练,得到PS-LM模型,所述PS-LM模型包括依次连接的分词嵌入模块和PS-LM模块,所述分词嵌入模块用于对网络流进行处理,得到所述网络流对应的词元序列的嵌入,所述PS-LM模块用于对所述词元序列的嵌入进行处理,得到所述词元序列中每个词元的输出向量;微调模块,用于基于第二训练数据集对网络流量分析模型进行有监督微调,得到训练好的网络流量分析模型,所述网络流量分析模型包括所述PS-LM模型和分类头,所述分类头用于执行下游任务对应的分类处理;分析模块,用于基于所述训练好的网络流量分析模型对待处理网络流进行分析,得到分析结果;其中,所述分析模块具体用于:基于扰动样本落入不同类别区域的概率计算样本鲁棒性;基于噪声扰动下所述训练好的网络流量分析模型在测试集上识别结果的分布情况计算模型鲁棒性;在所述样本鲁棒性和所述模型鲁棒性满足预设条件时,基于所述训练好的网络流量分析模型对待处理网络流进行分析,得到分析结果;其中,所述基于扰动样本落入不同类别区域的概率计算样本鲁棒性,包括:将所述扰动样本落入第一类别区域的概率确定为第一概率,将所述扰动样本落入第二类别区域的概率确定为第二概率,所述第一类别区域为置信概率最大的类别区域,所述第二类别区域为置信概率第二大的类别区域;利用二项式比例置信区间计算所述第一概率的下界和所述第二概率的上界;基于所述第一概率的下界和所述第二概率的上界的差值确定所述样本鲁棒性;其中,所述模型鲁棒性 为: ;其中, 基于PA曲线确定: ;其中, 为指示函数, 为第 个样本的标签, 为第 个样本由所述第一概率确定的标签, 且 , 为样本的数量, 为所述PA曲线中的坐标值, 为逻辑与, 为第 个样本对应的第一概率的下界, 为第 个样本对应的第二概率的上界。
6.一种电子设备,包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的程序;其特征是,所述处理器,用于读取存储器中的程序实现如权利要求1至4中任一项所述的基于包长序列的加密网络流量分析方法中的步骤。
7.一种可读存储介质,用于存储程序,其特征是,所述程序被处理器执行时实现如权利要求1至4中任一项所述的基于包长序列的加密网络流量分析方法中的步骤。