1.一种采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是包括以下步骤:1)对历年配电网发生的故障大小、频度进行分析,找出数据挖掘的类别,根据配电线路在线监测系统和智能公用配变监测系统等的数据源,进行数据采集;2)对数据源采取特征构造,并进行归一化处理,将数据由多个源合并成一致的数据库存储;3)对经上一步骤后的当前粒子群体进行弯矩法和凹凸系数法聚类数分析,获得样本最佳的聚类数;4)将数据样本按聚类数划分为若干个类别,采用粒子群算法计算数据样本与聚类中心的距离,优化聚类中心;5)在对样本进行聚类分析后,采用上下临界图的异常值识别标准划定诊断阈值,若样本距离聚类中心的距离大于诊断阈值,则判别该样本为离群样本,并剔除;进而得到“除噪”的样本数据,6)采用经过上述“除噪”处理后的样本数据,对配电网故障潜在规则进行预测。
2.按照权利要求1所述的采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是所述的配电网数据预处理方法,对经归一化处理后的配电网数据,进行弯矩法和凹凸系数法聚类数分析,采用以弯矩法为主、凹凸系数法为辅的聚类数选取机制,来获得样本最佳的聚类数。
3.按照权利要求1所述的采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是所述的弯矩法包括:让聚类数N从1开始取值直到取到配电网合适的聚类上限;对每一个N值进行聚类并且记下对应的所有样本的聚类误差,即聚类效果优劣;然后画出N和所有样本的聚类误差的关系图;最后选取弯曲棱角对应的N值作为最佳聚类数;其弯矩系数算法为:其中,N为聚类数,O b 为i簇中的样本对象,C i 为当前i簇的簇中心。
4.按照权利要求1所述的采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是所述的凹凸系数法包括:按簇内样本的距离远近,求出所有样本的凹凸系数后再求平均值,得到其平均凹凸系数;平均凹凸系数的取值范围为[-1,1],且簇间样本距离越远,平均凹凸系数越大,取平均凹凸系数最大的M为最佳聚类数;某个样本点D i 的凹凸系数算法为:其中,设k i 是点i到其所属簇中所有其它点的平均距离,l i 为点i到其所不在的任何簇中的所有点的最小距离;所述最近簇的定义是:其中S是某个簇R N 中的样本,用D i 到某个簇所有样本平均距离作为衡量该点到该簇的距离,并选择离D i 最近的一个簇作为最近簇。
5.按照权利要求1所述的采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是根据凹凸系数法确定出的最优N值,如果BMC的结论支持或与凹凸系数法不矛盾,那么由凹凸系数法直接确定出最优N值;如BMC的结论与凹凸系数法矛盾,以BMC的结论为最优N值。
6.按照权利要求1所述的采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是所述的配电网数据预处理方法,将数据样本求取的聚类数划分为N个类别,计算数据样本与聚类中心的距离;根据各个粒子的自身位置,找出局部极值和全局极值位置;不断更新粒子的位置到粒子群最优化解,优化聚类中心。
7.按照权利要求1所述的采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是所述的配电网数据预处理方法,在对样本进行聚类分析后,采用上下临界图的异常值识别标准划定诊断阈值,异常值通常被定义为大于D L -1.5GAP或小于D H +1.5GAP的值;其中D L 称为下四分位数,表示全部样本值中有四分之一的数据取值比它小;D H 称为上四分位数,表示全部样本值中有四分之一的数据取值比它大;GAP称为四分位数间距,是上四分位数D H 与下四分位数D L 之差,其间包含了全部观察值的一半。
8.按照权利要求7所述的采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是若所述的样本距离聚类中心的距离大于诊断阈值,则诊断该样本为离群样本,并剔除。
9.按照权利要求1所述的采用大数据聚类的基于粒子群原理的配电网数据预处理方法,其特征是所述的配电网数据预处理方法,克服了弯矩法和凹凸系数算法容易陷入局部极值的缺点,保持了粒子群算法的全局寻优性,同时还具有弯矩法和凹凸系数算法较快的收敛速度。