1.一种基于改进Apriori的配电网电压越限问题关联分析方法,其特征在于,包括以下步骤:S1:输入含配电网电压越限问题相关影响因素的文本信息,并按有关书写规范将其划分为约定性文本和描述性文本;S2:通过文本挖掘对描述性文本进行文本分类,用类别标签标记描述性文本,并将其与约定性文本重新构成新的输入样本;S3:根据不同事务和项集生成布尔矩阵,将新的输入样本输入至布尔矩阵,通过压缩矩阵向量的按位与运算得到项集支持度,并以此创建项集索引表;S4:通过项集索引表筛选出所有不小于最小支持度的项集即为频繁项集,重复S4,直至得到最大的频繁项集;S5:对频繁项集进行置信度计算,筛选出不小于最小置信度的频繁项集,即得到所需的关联规则;在步骤S1中,配电网电压越限问题相关影响因素划分为典型现状因素和环境因素,典型现状因素按照不同电网层级电压水平现状又分为10kV母线层、10kV线路层和配变台区层;所述10kV母线层的典型现状因素包括主变分接头档位和主变功率因数;10kV线路层的典型现状因素包括10kV线路功率因数、供电半径、线路负载率和线路型号;配变台区层的典型现状因素包括配变分接头档位、配变负载率、配变三相不平衡、台区供电半径和低压线路截面积;在步骤S2中,所述约定性文本是指具有固定语法结构与表述的专用词组,不同约定性文本具有各自特定的含义与类别;所述描述性文本是相对于约定性文本而言主观性强、规范程度低的文本,多以长句形式出现;在步骤S2中,包括以下方法:S21:结合电力分类词典,采用jieba分词算法对描述性文本进行中文分词处理,即将连续的字序列按照一定的规范重新组合成词序列;S22:剔除无实际区分作用的停用词;S23:根据电力分类词典,通过词典匹配的方式对分词进行筛选、分类,其中,同一描述性文本包含多个类别;S24:借助类别标签来标记描述性文本,将其与约定性文本重新构成新的数据集,并作为改进Apriori算法的输入样本。
2.根据权利要求1所述的一种基于改进Apriori的配电网电压越限问题关联分析方法,其特征在于,在步骤S3中,包括以下方法:S31:扫描输入样本,得到事务数据库T={T 1 ,T 2 ,…,T n },其中T j 是由若干个文本信息组成的具有唯一标识的事务,设I={I 1 ,I 2 ,…,I m }是事务数据库T中不同项组成的集合,满足 即每个事务包含的k-项集都是I的子集,k表示项集中项的个数,{I i }表示为1-项集;S32:设定最小支持度和最小置信度;最小支持度公式为 最小置信度公式为 式中: 且X∩Y=Φ,support_count(X∪Y)为支持度计数,表示项集X和Y同时出现在事务数据库的次数,total_count为事务数据库中事务的个数;S33:将事务数据库T转换成布尔矩阵M,其中行向量用不同项集标记,列向量用不同事务标记,行列按顺序排序,若第i个项集在第j个事务中,则矩阵的第i行、第j列的值d ij 为1,否则d ij 为0;S34:计算k-项集的支持度计数: 式中: 为I中任取k个项合并形成的k-项集索引表,&是对应行向量中各分量的与运算符。
3.根据权利要求2所述的一种基于改进Apriori的配电网电压越限问题关联分析方法,其特征在于,在步骤S4中,k-项集索引表与最小支持度计数比较,筛选出所有不小于最小支持度计数的项集即为k-频繁项集L k ,根据第一频繁项集性质对布尔矩阵M进行列压缩,若T j 所在列向量之和小于等于1,则删除该列向量;各列向量逐列计算,得到压缩后的矩阵M 1 ,根据第二频繁项集性质对矩阵M 1 进行行压缩,若I i 所在行向量之和小于最小支持度计数,则删去该行向量;各行向量逐行计算,得到压缩后的矩阵M 2 ,令k=k+1,从矩阵M 2 中任取两个项集组合成所有可能的k-项集,假设C i,k-1 和C j,k-1 分别是矩阵M 2 中任意两个项集,并令项集中的项按顺序排序,若两个项集中的前(k-2)项相同,则连接组合,即C p,k =C i,k-1 ∪C j,k-1 ,否则不连接组合,从k-项集索引表中筛选出所有不小于最小支持度计数的项集即为k-频繁项集L k ,并根据k-频繁项集L k 重新生成布尔矩阵M,重复筛选,直到不再生成频繁项集,所有频繁项集L表示为L=∪L k 。
4.根据权利要求3所述的一种基于改进Apriori的配电网电压越限问题关联分析方法,其特征在于,在步骤S5中,对频繁项集计算置信度,其中X∈L,Y∈L,X∪Y∈L,且X∩Y=Φ,筛选出不小于最小置信度的频繁项集,即得到所需的关联规则。
5.根据权利要求3所述的一种基于改进Apriori的配电网电压越限问题关联分析方法,其特征在于,所述第一频繁项集性质为如果数据库中某条事务的长度为K,那么这条事务就不可能包含任何项数大于K的频繁项集。
6.根据权利要求3所述的一种基于改进Apriori的配电网电压越限问题关联分析方法,其特征在于,所述第二频繁项集性质为非频繁项集的任一超集必定也是非频繁项集。