1.一种流数据的多分区聚类预处理方法,其特征在于,包括以下步骤:步骤1,确定流数据态势因子的范围,并根据态势因子与网络安全态势的关联度,对流数据态势因子进行筛选;步骤2,根据筛选得到的态势因子,将流数据库划分为多个分区,具体为:(1)高维数据分区;对于高维数据,对筛选出的态势因子进行单因子方差分析;经过统计分析,若因子A不显著,则标记为高关联度因子,若A显著,则标记为低关联度因子;其中,对高关联度因子采用基于分布的分区方式,对低关联度因子采取等距的三角分区方式;(2)低维数据分区对于低维数据采用随机取样算法对整个数据库进行取样,采用直方图方法统计分析采样点投影在X轴和Y轴上的数据分布特性,确定在哪一维上进行分区、分区的数量以及分区的边界;步骤3,对每个分区,分别使用DBSCAN算法进行局部聚类;步骤4,合并各局部聚类,得到流数据的多分区聚类预处理结果。
2.根据权利要求1所述的流数据的多分区聚类预处理方法,其特征在于:步骤1所述确定流数据态势因子的范围,并根据态势因子与网络安全态势的关联度,对流数据态势因子进行筛选,具体如下:(1)确定流数据态势因子的范围;(2)用随时刻K变化的态势数列 和态势因子数列X i (0) ,分别作为参考数列和比较数列;(3)对所述参考数列和比较数列进行无量纲化处理;(4)确定K时刻所述参考数列与比较数列的灰色关联系数ε i (K),公式如下:式中,ρ是分辨系数,ρ∈[0,∞);K=1,2,…,L表示L个时刻中第K个时刻;i=1,2,...m表示第i个因子;(5)计算态势因子与网络安全态势的关联度ρ 0,i ,公式如下:(6)对流数据态势因子进行筛选,当所述关联度ρ 0,i 大于阈值的时候,选用该流数据态势因子,否则剔除。
3.根据权利要求1所述的流数据的多分区聚类预处理方法,其特征在于,步骤3所述对每个分区,分别使用DBSCAN算法进行局部聚类,具体过程如下:(1)构建分区自身的R*树;(2)建立k-dist图;(3)选取局部扫描半径Eps值,使用DBSCAN算法进行局部聚类。
4.根据权利要求1所述的流数据的多分区聚类预处理方法,其特征在于,步骤4所述合并各局部聚类,具体过程如下:(1)两个类A和B的合并;(2)归并噪声点;(3)由噪声点产生新类。
5.根据权利要求1所述的流数据的多分区聚类预处理方法,其特征在于,所述对低关联度因子采取等距的三角分区方式,具体步骤如下:(a)给定一个d维的数据集D=(D 1 ,D 2 ,……D d ),设第e维上的属性值分布在区间[w e ,h e )中,其中e=1,2,……,d,则S=[w 1 ,h 1 )×[w 2 ,h 2 )×...[w d ,h d )表示该e维数据空间;(b)将数据空间的每一维划分成长度相等的t段,这样来自于每一维的一个段相交形成一个矩形,称为网格单元;网格单元C e 表示为C e1 ,C e2 ,...C ed ,C ej =[w ej ,h ej )是一个左闭右开的区间,表示D j (j=1,2,……,d)上的一个段;(c)再取每个矩形的与X轴正方向成锐角的对角线,对矩形进行分割,形成三角单元T e (T e1 ,T e2 ,...T ed )。
6.根据权利要求4所述的流数据的多分区聚类预处理方法,其特征在于,步骤(1)中所述两个类A和B合并,必须满足当且仅当:(a)A、B分别处于相邻的两个分区P A 、P B 中;(b)设Eps(P A ),Eps(P B )分别是P A ,P B 的Eps邻域半径值,Eps(P A ,P B )=min{Eps(P A ),Eps(P B )},E A ,E B 分别是在局部聚类过程中保存的P A 和P B 的边界区域点集, q∈E B ,满足DISTANCE{p,q}≤Eps(P A ,P B )。
7.根据权利要求4所述的流数据的多分区聚类预处理方法,其特征在于,步骤(2)所述归并噪声点,必须满足当且仅当:(a)噪声点P N 和类O分别处于相邻的两个分区中;(b) E O 是局部聚类过程中保存在类O所在分区的边界区域点集,P O 是类O所处的分区,满足DISTANCE{P N ,P}≤Eps(P O )。