有效
基于联邦式在线主动学习的网络流量分类系统及方法
朱承、刘蔚柯、丁兆云、刘斌、朱先强、汤罗浩、刘毅、周鋆
中国人民解放军国防科技大学
朱
朱承 专利 105
中国人民解放军国防科技大学知识系统计算模型系统电子数据处理
刘
刘蔚柯 专利 24
中国人民解放军国防科技大学物理仪器计算模型系统计算技术
丁
丁兆云 专利 67
中国人民解放军国防科技大学知识系统数据存储检索计算模型系统
刘
刘斌 专利 66
中国人民解放军国防科技大学计算模型系统电子数据处理计算技术
朱
朱先强 专利 91
中国人民解放军国防科技大学数学模式系统计算模型系统电子数据处理
汤
汤罗浩 专利 13
中国人民解放军国防科技大学电子数据处理计算技术数据存储检索
刘
刘毅 专利 40
中国人民解放军国防科技大学电子数据处理计算技术物理仪器
周
周鋆 专利 73
中国人民解放军国防科技大学数学模式系统计算模型系统生物模型计算
摘要
本申请涉及一种基于联邦式在线主动学习的网络流量分类系统及方法。所述系统包括:联邦式主动学习中心和多个边缘主动学习器;联邦式主动学习中心包括主动学习服务器、联邦聚合计算服务器和专家组;构建主动学习策略和深度学习方法使联邦式主动学习中心不断更新自身的分类模型;根据各边缘主动学习器的固有特性以及其动态请求联邦式主动学习中心进行标注的疑难实例信息进行动态聚类,得到疑难实例的真实标签后将该真实标签发回给位于同一簇内的所有边缘主动学习器,边缘主动学习器根据当前分类模型对当前边缘主动学习器所在的网络进行网络流量分类。采用本方法能够解决多类不平衡、概念漂移和概念演化问题。
1.一种基于联邦式在线主动学习的网络流量分类系统,其特征在于,所述系统包括联邦式主动学习中心和多个边缘主动学习器;所述联邦式主动学习中心包括主动学习服务器、联邦聚合计算服务器和专家组;所述主动学习服务器用于在任务开始前获取有标签样本构成的训练集,根据所述训练集对深度学习模型进行训练,得到网络流量分类模型;将所述网络流量分类模型下发到各个边缘主动学习器,在任务开始后根据预先构建的主动学习方法对联邦式主动学习中心内的网络流量分类模型进行迭代更新,并利用更新后的分类模型对联邦式主动学习中心所在的主干网网络流量进行在线流量分类;所述边缘主动学习器用于根据所述网络流量分类模型对当前边缘主动学习器所在的网络进行网络流量分类,将不能分类的流量实例作为疑难实例,并请求联邦式主动学习中心进行协助分类;所述主动学习服务器用于对边缘主动学习器请求协助分类的疑难实例进行类别标注,并筛选出需专家组进一步人工标注的疑难实例;所述专家组用于对由主动学习服务器筛选出的疑难实例进行标注,产生带有人工标签的训练样本实例;所述主动学习服务器用于利用专家组标注的训练样本实例对自身的网络流量分类模型进行训练更新;所述联邦聚合计算服务器用于根据各边缘主动学习器的固有特性以及请求协助分类的疑难实例进行动态聚类,得到多个边缘主动学习器的类簇;将所述训练样本实例发送给位于同一簇内的所有边缘主动学习器;所述边缘主动学习器利用所述训练样本实例对自身的网络流量分类模型进行训练更新,并根据更新后的分类模型对边缘网络流量进行流量分类;所述联邦聚合计算服务器用于对同一簇内的所有边缘主动学习器得到的网络流量分类模型进行聚合与发布。
2.根据权利要求1所述的系统,其特征在于,所述主动学习服务器用于在任务开始后根据预先构建的主动学习方法对联邦式主动学习中心内的网络流量分类模型进行迭代更新,并利用更新后的分类模型对联邦式主动学习中心所在的主干网网络流量进行在线流量分类,包括:获得联邦式主动学习中心所在的主干网网络流量实例;所述主干网网络流量实例为不包含流量类型标签的网络流量实例;根据当前的网络流量分类模型对所述主干网网络流量实例进行分类预测,得到预测结果数据;所述预测结果数据为包含预测类型标签的网络流量数据;根据预先构建的混合标签请求策略判断所述预测结果数据是否被所述混合标签请求策略选中;若所述预测结果数据被混合标签请求策略选中,则请求专家组人工标注类型,得到同时包含预测类型标签和真实类型标签的训练样本;所述训练样本用于对网络流量分类模型进行训练,得到更新后的分类模型;若所述预测结果数据未被混合标签请求策略选中,则将所述预测结果数据作为所述主干网网络流量实例的预测标签。
3.根据权利要求2所述的系统,其特征在于,所述混合标签请求策略由基于可变最小置信度阈值向量的不确定性标签请求策略、基于狄利克雷过程的概念演化检测策略和一种选择性标签请求策略组成。
4.根据权利要求3所述的系统,其特征在于,所述主动学习服务器用于根据预先构建的混合标签请求策略判断所述预测结果数据是否被所述混合标签请求策略选中,包括:根据可变最小置信度阈值向量不确定性标签请求策略为每一类网络流量设置一个最小置信度阈值,当有新的网络流量类别出现时,则拓展可变最小置信阈值向量的大小,如果流量分类模型对实例 x 给出的预测标签 predLabel 的置信度 confid 小于可变最小置信阈值向量 D 中预测标签的最小置信度阈值 D [ predLabel ],则实例 x 被不确定性标签请求策略选中并上传给专家组,由专家组人工标注真实标签并动态调整最小置信度阈值向量 D 中的元素的值;若实例 x 未被不确定性标签请求策略选中,根据基于狄利克雷过程的概念演化检测策略判断实例 x 是否会被概念演化检测策略选中;若实例 x 未被概念演化检测策略选中,根据选择性标签请求策略随机选择没有被不确定性策略和概念演化检测策略选中的实例送交专家进行人工标注由专家组人工标注真实标签。
5.根据权利要求4所述的系统,其特征在于,所述主动学习服务器和边缘主动学习器还用于动态调整最小置信度阈值向量 D 中的元素的值,包括:如果实例 x 被模型预测正确,但实例 x 是由不确定标签请求策略选中的,则根据公式 对元素 D [ predLabel ]的值进行减小调
整,得到调整后的最小置信度阈值;其中, ;如果对实例 x 的预测不正确,且实例 x 没有被不确定性标签请求策略选中,则根据公式 对元素 D [ predLabel ]的值进行减小调整,得到调整后
的最小置信度阈值。
6.根据权利要求4所述的系统,其特征在于,所述主动学习服务器和边缘主动学习器还用于根据基于狄利克雷过程的概念演化检测策略判断实例 x 是否会被概念演化检测策略选中,包括:根据相对密度的聚类算法对所述训练集进行聚类,得到多个微簇;所述微簇表示为 ,其中, 表示微簇的半径, 表示微簇的中心, 表示微簇包含的样本数, 表示微簇的活跃度, 表示微簇的时间计数器, 表示
已有微簇的序号;首先判断实例 x 是否落入已有的所述多个微簇中,若实例 x 落入已有微簇 中,则 , ,修正 、 和 的值;若所述实例 x 未落入已有微簇中,则查询出以实例 x 为中心,以微簇最大半径为半径的
邻域内的所有微簇,得到微簇集合为 ,其
中, 表示微簇个数;根据狄利克雷过程混合模型的中餐馆过程对所述实例 x 落入所述微簇集合中各个微簇和新建微簇的概率进行计算,根据计算得到的多个概率构成Categorical分布,对Categorical分布进行一次采样得到实例 x 的微簇序号;若所述微簇序号为已有微簇的序号,则将已有微簇的标签作为实例 x 的预测标签,若所述微簇序号为新建微簇的序号,则将实例 x 归入一个新建簇,并请求专家组对实例 x 进行标注,得到实例 x 的真实标签;对没有新实例加入的其他微簇进行信息修正,若修正后的微簇的活跃度小于预先设定的微簇的活跃度最小阈值,则删除修正后的微簇。
7.根据权利要求6所述的系统,其特征在于,所述主动学习服务器和边缘主动学习器还用于根据狄利克雷过程混合模型的中餐馆过程对所述实例 x 落入所述微簇集合中各个微簇和新建微簇的概率进行计算,包括:根据狄利克雷过程混合模型的中餐馆过程计算所述实例 x 落入所述微簇集合中各个微簇的概率为其中, 表示所述微簇集合中包含的样本总数, 表示调整参数, 表示
第 j 个微簇包含的样本数;根据狄利克雷过程混合模型的中餐馆过程计算所述实例 x 落入新建微簇的概率为 。
8.根据权利要求2所述的系统,其特征在于,所述边缘主动学习器用于根据所述更新后的分类模型对边缘网络进行流量分类,包括:获取边缘主动学习器所在的边缘网络流量实例;所述边缘网络流量实例为不包含流量类型标签的网络流量实例;根据当前更新后的分类模型对所述边缘网络流量实例进行分类预测,得到预测结果数据;所述预测结果数据为包含预测类型标签的网络流量数据;根据预先构建的混合标签请求策略判断所述预测结果数据是否被所述混合标签请求策略选中;若所述预测结果数据被混合标签请求策略选中,则将未标注的疑难实例上报到联邦式主动学习中心,请求联邦式主动学习中心协助分类;若所述预测结果数据未被混合标签请求策略选中,则将所述预测结果数据作为所述边缘网络流量实例的预测标签。
9.一种基于联邦式在线主动学习的网络流量分类方法,其特征在于,所述方法包括:根据主动学习服务器在任务开始前获取有标签样本构成的训练集,利用所述训练集对深度学习模型进行训练,得到网络流量分类模型;将所述网络流量分类模型下发到各个边缘主动学习器,在任务开始后根据预先构建的主动学习方法对联邦式主动学习中心内的网络流量分类模型进行迭代更新,并利用更新后的分类模型对联邦式主动学习中心所在的主干网网络流量进行在线流量分类;在边缘主动学习器中根据所述网络流量分类模型对当前边缘主动学习器所在的网络进行网络流量分类,将不能分类的流量实例作为疑难实例,并请求联邦式主动学习中心进行协助分类;利用主动学习服务器对边缘主动学习器请求协助分类的疑难实例进行类别标注,并筛选出需专家组进一步人工标注的疑难实例;利用专家组对由主动学习服务器筛选出的疑难实例进行标注,产生带有人工标签的训练样本实例;在主动学习服务器中利用专家组标注的训练样本实例对自身的网络流量分类模型训练更新;在联邦聚合计算服务器中根据各边缘主动学习器的固有特性以及其请求协助分类的疑难实例进行动态聚类,得到多个边缘主动学习器的类簇;将所述训练样本实例发送给位于同一簇内的所有边缘主动学习器;在边缘主动学习器中利用所述训练样本实例对自身的分类模型进行训练更新,并根据更新后的分类模型对边缘网络流量进行流量分类;根据联邦聚合计算服务器对同一簇内的所有边缘主动学习器得到的分类模型进行聚合与发布。
暂无引用专利



