有效
一种基于无监督生成网络的多编码体系互迁移方法
傅骏伟、王豆、郭鼎、姜志锋、孙永平、吴林峰、郑必君、刘凯锐、吴业成、俞荣栋
浙江浙能数字科技有限公司
傅
傅骏伟 专利 36
浙江浙能技术研究院有限公司电子数据处理计算技术物理仪器
王
王豆 专利 59
浙江大学物理仪器计算模型系统电子数据处理
郭
郭鼎 专利 54
浙江浙能技术研究院有限公司计算技术物理仪器计算模型系统
姜
姜志锋 专利 23
浙江浙能数字科技有限公司电子数据处理计算技术物理仪器
孙
孙永平 专利 34
国网浙江省电力有限公司电力科学研究院物理仪器动力机械电子数据处理
吴
吴林峰 专利 16
浙江大学物理仪器计算技术控制监控
郑
郑必君 专利 10
浙江浙能技术研究院有限公司物理仪器计算模型系统计算技术
刘
刘凯锐 专利 14
浙江浙能台州第二发电有限责任公司动力机械特殊废物焚烧燃烧设备与方法
吴
吴业成 专利 12
浙江浙能技术研究院有限公司特殊废物焚烧燃烧设备与方法动力机械
俞
俞荣栋 专利 106
浙江浙能数字科技有限公司计算技术物理仪器计算模型系统
摘要
本发明涉及一种基于无监督生成网络的多编码体系互迁移方法,包括步骤:通过采集设备获取编码规则A下的编码与语义描述的数据集;由两种规则编码数据集分别进行等量的随机采样。本发明的有益效果是:本发明采用无监督多编码体系互迁移模型,通过采集设备获取数据集,对数据集中数据进行随机采样,并划分为训练集和测试集,用于训练无监督多编码体系互迁移模型,绕开人工标注的流程,工作量小、求证简单、出错率低;本发明通过无数据标注方法实现无监督的多编码体系互相迁移,克服了传统底层数据治理标准化、统一化方法仅用于设备编码,尚未提出解决方案破解不同编码体系下的自动映射问题。
1.一种基于无监督生成网络的多编码体系互迁移方法,其特征在于,包括以下步骤:步骤1、通过采集设备获取编码规则A下的编码与语义描述的数据集: ,其中 为编码, 为语义描述, m 为编码规则A下的数据集总量;通过采集设备获取编码规则B下的编码与语义描述的数据集: ,其中 为编码, 为语义描述, n 为编码规则B下的数据集总量;步骤2、由步骤1获得的编码数据集 和 分别进行等量 k 的随机采样,得到编码规则A下的训练集 、编码规则B下的训练集 、编码规则A下的测试集 和编码规则B下的测试集 , 其中 指实数空间, 为编码规则A下的编码与语义描述的数据集的采样总数, 为训练集采样数量, 为编码规则A下的训练集采样数量, 为编码规则B下的编码与语义描述的数据集的采样总数, 为编码规则B下的训练集采样总数,将数据集 、 、 、 保存在存储装置的存储单元内;步骤3、根据步骤2得到的数据集 、 、 、 ,对编码和语义描述进行分词,建立编码实体字典 ,其中 q 为编码实体编号, 为编码实体词;对语义描述建立语义描述实体字典 ,其中 p 为描述实体编号, 为描述实体词;步骤4、根据步骤2得到的数据集 、 、 、 ,步骤3获得的编码实体字典 、语义描述实体字典 ,对编码与语义描述进行文本向量化表征,得到编码向量和描述向量;步骤5、通过由步骤2获得的编码规则A下的训练集 和编码规则B下的训练集 ,训练无监督多编码体系互迁移模型,无监督多编码体系互迁移模型由编码网络与解码网络组成;步骤6、将无监督多编码体系互迁移模型部署计算模块,并将编码规则A下的编码与语义描述进行输入,得到编码规则B下的编码与语义描述;或将编码规则B下的编码与语义描述进行输入,得到编码规则A下的编码与语义描述。
2.根据权利要求1所述基于无监督生成网络的多编码体系互迁移方法,其特征在于:步骤1中编码由英文字母与数字组成,语义描述由中文组成,编码与语义描述一一对应;编码规则A与编码规则B下的编码与语义描述的数据集的数据总量比例为1:1;编码规则A下的编码与语义描述的数据集中,训练集与测试集的比例为3:2;编码规则B下的编码与语义描述的数据集中,训练集与测试集的比例为7:3。
3.根据权利要求1所述基于无监督生成网络的多编码体系互迁移方法,其特征在于:步骤2中随机采样方法为服从正态分布的随机采样方法。
4.根据权利要求1所述基于无监督生成网络的多编码体系互迁移方法,其特征在于:步骤3采用哈工大LTP方法对编码和语义描述进行分词,并将编码实体字典保存在存储装置的存储单元内。
5.根据权利要求1所述基于无监督生成网络的多编码体系互迁移方法,其特征在于,步骤4具体包括以下步骤:步骤4.1、通过编码实体字典 对编码进行分词并向量化,根据最长编码长度进行占位符填充,得到同长度编码向量 ;步骤4.2、通过语义描述实体字典 对语义描述进行分词并向量化,根据最长语义描述长度进行占位符填充,得到同长度描述向量 。
6.根据权利要求1或5所述基于无监督生成网络的多编码体系互迁移方法,其特征在于,步骤5具体包括以下步骤:步骤5.1、将编码规则A下的训练集 进行随机采样并分组拆分构成批次数据,批次数据由编码 和编码语义描述 组成,将该批次数据作为编码规则A下无监督多编码体系互迁移模型的输入 ;将编码规则B下的训练集 进行随机采样并分组拆分构成批次数据,批次数据由编码 和编码语义描述组成,将该批次数据作为编码规则B下的无监督多编码体系互迁移模型的输入 ;步骤5.2、构建基于门控循环单元的编码网络,基于门控循环单元的编码网络由嵌入层与GRU编码层组成,嵌入层将无监督多编码体系互迁移模型的输入值转换为固定尺寸的特征向量 ,对固定尺寸的特征向量 通过GRU编码层计算编码特征 :上式中,将编码 、 编码语义描述 作为编码规则A下嵌入层的输入,得到编码特征向量 和编码描述特征向量 ;将编码特征向量 和编码描述特征向量 作为编码规则A下门控循环单元的输入,得到隐含编码特征 和隐含编码描述特征 ;将编码 、 编码语义描述 作为编码规则B下嵌入层的输入,得到编码特征向量 和编码描述特征向量 ;将编码特征向量 和编码描述特征向量 作为编码规则B下门控循环单元的输入,得到隐含编码特征 和隐含编码描述特征 ;步骤5.3、构建基于门控循环单元的解码网络,基于门控循环单元的解码网络由GRU层和全连接层组成:上式中,将编码规则A下的隐含编码特征 和隐含编码描述特征 输入到编码规则A下的门控循环单元,解码得到隐含编码解码特征 和隐含编码描述解码特征 ,并将 、 作为编码规则A下全连接层的输入,得到重构编码特征 和重构编码描述特征 ;将编码规则B下的隐含编码特征 和隐含编码描述特征 输入到编码规则B下的门控循环单元,解码得到隐含编码解码特征 和隐含编码描述解码特征 ,并将 、 作为编码规则B下全连接层的输入,得到重构编码特征 和重构编码描述特征 ;将编码规则A下的隐含编码特征 和隐含编码描述特征 输入编码规则A至编码规则B下的门控循环单元,解码得到隐含编码解码特征 和隐含编码描述解码特征 ,并将 、 作为编码规则A至编码规则B下全连接层的输入,得到重构编码特征 和重构编码描述特征 ;将编码规则B下的隐含编码特征 和隐含编码描述特征 输入到编码规则B至编码规则A下的门控循环单元,解码得到隐含编码解码特征 和隐含编码描述解码特征 ,并将 、 作为编码规则B至编码规则A下全连接层的输入,得到重构编码特征 和重构编码描述特征 ;步骤5.4、由步骤5.3得到的重构结果 、 、 、 与步骤5.1中编码规则A下无监督多编码体系互迁移模型的输入 、编码规则B下的无监督多编码体系互迁移模型的输入 ,分别计算得到编码规则A下无监督多编码体系互迁移模型的损失函数与编码规则B下无监督多编码体系互迁移模型的损失函数:上式中, N 为编码总数,用作迭代次数;分别更新无监督多编码体系互迁移模型中的权重参数;步骤5.5、重复进行步骤5.1至步骤5.4,直至迭代次数 N 达到预设值或无监督多编码体系互迁移模型的偏差趋于收敛,得到训练好的无监督多编码体系互迁移模型。
7.根据权利要求1所述基于无监督生成网络的多编码体系互迁移方法,其特征在于:步骤5中无监督多编码体系互迁移模型由两个编码网络与四个解码网络组成;编码网络为编码规则A下编码及语义描述到编码特征的编码网络、编码规则B下编码及语义描述到编码特征的编码网络;解码网络为由编码规则A下编码特征生成的编码规则A下重构特征的解码网络、由编码规则A下编码特征生成编码规则B下重构特征的解码网络、由编码规则B下编码特征生成编码规则B下重构特征的解码网络、由编码规则B下编码特征生成编码规则A下重构特征的解码网络。
8.根据权利要求6所述基于无监督生成网络的多编码体系互迁移方法,其特征在于:步骤5.2中还引入embedding层用于提取稠密信息;步骤5.3中还引入embedding层用于提取稠密信息。
9.根据权利要求6所述基于无监督生成网络的多编码体系互迁移方法,其特征在于:步骤5.4中计算编码规则A下无监督多编码体系互迁移模型的损失函数与编码规则B下无监督多编码体系互迁移模型的损失函数时,采用多类别交叉熵。
10.根据权利要求1所述基于无监督生成网络的多编码体系互迁移方法,其特征在于:步骤6中将无监督多编码体系互迁移模型部署计算模块时采用基于Python环境的Flask框架部署,并将python代码封装成API,构成服务API计算单元;步骤6还将无监督多编码体系互迁移模型的输出结果保存到存储装置的存储单元内。



