1.一种识别分布式训练系统异常更新的方法,其特征在于,包括:接收各计算组发送的流量统计数据;其中,所述流量统计数据包括所述计算组多次更新的起始时间与结束时间、通信流量大小和发往参数服务器的编号;根据隶属度矩阵和各所述计算组的流量特征属性数据对各所述计算组进行聚类分类,得到分类结果;其中,所述流量特征属性数据为根据所述流量统计数据计算得到;根据所述分类结果分析所述分布式训练系统的工作情况;其中,所述根据所述分类结果分析所述分布式训练系统的工作情况包括:将当前计算组所在的各聚类的元素个数分别与预设的第一阈值进行比较;其中,当前所述计算组为全部所述计算组的其中一个计算组;若当前所述计算组所在的各所述聚类的元素个数均不小于所述第一阈值,则确定当前所述计算组正常;否则,分别计算当前所述计算组所在的各所述聚类的聚类中心与选取的计算组所在的各聚类的聚类中心的相对距离;若当前所述计算组所在的各所述聚类的所述元素个数均小于所述第一阈值且各所述相对距离的绝对值均大于第二阈值,则确定当前所述计算组异常;否则,确定当前所述计算组正常;判断是否检测完全部所述计算组;若未检测完,则进入所述将当前计算组所在的各聚类的元素个数分别与预设的第一阈值进行比较的步骤;若全部检测完,则根据各所述计算组的工作情况得到所述分布式训练系统的工作情况。
2.根据权利要求1所述的识别分布式训练系统异常更新的方法,其特征在于,各所述计算组包括多维流量特征属性,则所述根据隶属度矩阵和各所述计算组的流量特征属性数据对各所述计算组进行聚类分类,得到分类结果包括:初始化所述隶属度矩阵;其中,一种流量特征属性对应一个隶属度矩阵;根据所述隶属度矩阵对各所述计算组进行聚类分类;根据各所述计算组对当前聚类的隶属度和与各所述计算组的当前流量特征属性对应的流量特征属性数据计算得到当前所述聚类的聚类中心;其中,当前所述聚类为按照当前所述流量特征属性对应的流量特征属性数据进行聚类分类所得到的全部聚类的其中一个;当前所述计算组为全部计算组其中一个,当前所述流量特征属性为全部流量特征属性其中一个;根据当前所述计算组的当前所述流量特征属性对应的流量特征属性数据和当前所述聚类的聚类中心计算当前所述计算组相对当前所述聚类的聚类中心的距离;判断是否计算各所述计算组相对聚类分类的全部所述聚类的聚类中心的距离;其中,所述聚类分类的全部所述聚类为按照各所述流量特征属性对应的流量特征属性数据进行聚类分类所得到的全部聚类;若未完成计算,则进入所述根据各所述计算组对当前聚类的隶属度和与各所述计算组的当前流量特征属性对应的流量特征属性数据计算得到当前所述聚类的聚类中心的步骤;若完成计算,则根据各所述计算组对聚类分类的各所述聚类的隶属度和各所述计算组相对聚类分类的各所述聚类的聚类中心的距离计算当前目标函数值;根据当前所述目标函数值与上次计算的所述目标函数值计算目标函数差值,并将所述目标函数差值与预设的分类精度系数进行比较;若所述目标函数差值大于所述分类精度系数,则通过各所述计算组相对聚类分类的各所述聚类的聚类中心的距离更新所述隶属度矩阵,根据更新后的隶属度矩阵重新分类,并进入所述根据各所述计算组对当前聚类的隶属度和与各所述计算组的当前流量特征属性对应的流量特征属性数据计算得到当前所述聚类的聚类中心的步骤;若所述目标函数差值不大于所述分类精度系数,则确定所述分类结果。
3.根据权利要求2所述的识别分布式训练系统异常更新的方法,其特征在于,在所述根据当前所述目标函数值与上次计算的所述目标函数值计算目标函数差值之前,在所述根据各所述计算组对聚类分类的各所述聚类的隶属度和各所述计算组相对聚类分类的各所述聚类的聚类中心的距离计算当前目标函数值之后,还包括:将迭代次数加一;判断所述迭代次数是否小于预设的迭代阈值;若小于,则进入所述根据当前所述目标函数值与上次计算的所述目标函数值计算目标函数差值的步骤;若不小于,则进入所述确定所述分类结果的步骤。
4.根据权利要求1所述的识别分布式训练系统异常更新的方法,其特征在于,在所述根据所述分类结果分析所述分布式训练系统的工作情况之后,还包括:若所述分布式训练系统正常,则控制报警装置给出正确提示;若所述分布式训练系统异常,则控制所述报警装置报错。
5.根据权利要求1所述的识别分布式训练系统异常更新的方法,其特征在于,在所述检测完全部所述计算组之后,还包括:根据检测结果判断是否存在异常计算组;若存在,则对所述异常计算组进行维护处理。
6.一种识别分布式训练系统异常更新的装置,其特征在于,包括:接收模块,用于接收各计算组发送的流量统计数据;其中,所述流量统计数据包括所述计算组多次更新的起始时间与结束时间、通信流量大小和发往参数服务器的编号;分类模块,用于根据各所述计算组的流量特征属性数据对各所述计算组进行聚类分类,得到分类结果;其中,所述流量特征属性数据为根据所述流量统计数据计算得到;分析模块,用于根据所述分类结果分析所述分布式训练系统的工作情况;其中,所述根据所述分类结果分析所述分布式训练系统的工作情况包括:将当前计算组所在的各聚类的元素个数分别与预设的第一阈值进行比较;其中,当前所述计算组为全部所述计算组的其中一个计算组;若当前所述计算组所在的各所述聚类的元素个数均不小于所述第一阈值,则确定当前所述计算组正常;否则,分别计算当前所述计算组所在的各所述聚类的聚类中心与选取的计算组所在的各聚类的聚类中心的相对距离;若当前所述计算组所在的各所述聚类的所述元素个数均小于所述第一阈值且各所述相对距离的绝对值均大于第二阈值,则确定当前所述计算组异常;否则,确定当前所述计算组正常;判断是否检测完全部所述计算组;若未检测完,则进入所述将当前计算组所在的各聚类的元素个数分别与预设的第一阈值进行比较的步骤;若全部检测完,则根据各所述计算组的工作情况得到所述分布式训练系统的工作情况。
7.一种识别分布式训练系统异常更新的装置,其特征在于,包括:存储器,用于存储计算机程序;处理器,用于执行所述计算机程序时实现如权利要求1至5任一项所述的识别分布式训练系统异常更新的方法的步骤。
8.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现如权利要求1至5任一项所述的识别分布式训练系统异常更新的方法的步骤。