1.一种结构化数据增强方法,其特征在于,包括:获取原始结构化数据集,将所述原始结构化数据集作为训练数据集,迭代更新所述训练数据集,并根据每次迭代更新的所述训练数据集重新训练预设的分类器,以通过所述分类器获得若干增强样本,直至前后两次迭代得到的所述若干增强样本的平均KL散度满足预设条件,则终止迭代,将当前更新的所述训练数据集作为增强后的结构化数据;其中,所述原始结构化数据集具体由电力数据构成;其中,每次重新训练所述分类器后,通过所述分类器从所述原始结构化数据集中筛选出熵值靠前的若干第一样本,并掩蔽每个所述第一样本中特征重要性分值靠前的若干关键字段后,对各所述第一样本进行补全操作,获得补全数据集;每次迭代更新过程中得到所述补全数据集后,从所述补全数据集中筛选出KL散度小于预设阈值的补全样本作为所述增强样本,以通过所有所述增强样本更新当前迭代的所述训练数据集;所述掩蔽每个所述第一样本中特征重要性分值靠前的若干关键字段,包括:将所述第一样本输入至所述分类器,对所述第一样本中的各第一字段进行重要性分析,获得各第一字段的重要性指标;根据所述重要性指标,计算所述第一样本中各所述第一字段的特征重要性分值;将特征重要性分值靠前的若干第一字段作为对应所述第一样本的所述若干关键字段,并掩蔽所述第一样本中的所述若干关键字段。
2.如权利要求1所述的一种结构化数据增强方法,其特征在于,所述通过所述分类器从所述原始结构化数据集中筛选出熵值靠前的若干第一样本,包括:将所述原始结构化数据集中的各原始样本输入至所述分类器,获得所述原始样本各自对应的第一概率分布;根据所述第一概率分布,计算对应所述原始样本的熵值;按照熵值的大小对各所述原始样本排序,取熵值靠前的若干原始样本作为所述若干第一样本。
3.如权利要求2所述的一种结构化数据增强方法,其特征在于,所述根据所述第一概率分布,计算对应所述原始样本的熵值,包括:所述第一概率分布包括:所述原始样本属于各类别的第一概率值;针对所述原始样本所属的一种所述类别,计算所述类别对应所述第一概率值与所述第一概率值对应底数的乘积;累加所述原始样本所属各所述类别对应的乘积后,将累加和取负,得到所述原始样本的熵值。
4.如权利要求1所述的一种结构化数据增强方法,其特征在于,所述对各所述第一样本进行补全操作,包括:针对每一所述第一样本,根据所述第一样本中所述若干关键字段以外的第一字段,构建对应的提示词;针对每一所述第一样本,将所述第一样本及其对应的所述提示词输入至预训练完毕的大语言模型中,反复执行若干次补全操作,生成对应的若干补全样本。
5.如权利要求4所述的一种结构化数据增强方法,其特征在于,所述从所述补全数据集中筛选出KL散度小于预设阈值的补全样本作为所述增强样本,包括:针对每一所述补全样本中每一补全字段,根据所述补全字段在所述原始结构化数据集以及所述补全数据集的第二概率分布,计算所述补全字段的KL散度;根据所述补全样本中各所述补全字段的KL散度,计算对应各所述补全样本的KL散度。
6.如权利要求5所述的一种结构化数据增强方法,其特征在于,所述根据所述补全字段在所述原始结构化数据集以及所述补全数据集的第二概率分布,计算所述补全字段的KL散度,包括:所述补全字段的KL散度计算公式具体为:其中, 为补全字段 的KL散度, 为补全字段 在原始结构化数据集的经验分布, 为补全字段 在根据其对应第一样本所得到的若干补全样本中的生成分布; 为补全字段 的可能取值; 为补全字段 在原始结构化数据集中值为 的第二概率值; 为补全字段 在根据其对应第一样本所得到的若干补全样本中值为 的第三概率值。
7.一种结构化数据增强装置,其特征在于,包括:迭代模块、补全数据集获取模块以及增强样本获取模块;其中,所述迭代模块,用于获取原始结构化数据集,将所述原始结构化数据集作为训练数据集,迭代更新所述训练数据集,并根据每次迭代更新的所述训练数据集重新训练预设的分类器,以通过所述分类器获得若干增强样本,直至前后两次迭代得到的所述若干增强样本的平均KL散度满足预设条件,则终止迭代,将当前更新的所述训练数据集作为增强后的结构化数据;其中,所述原始结构化数据集具体由电力数据构成;所述补全数据集获取模块,用于每次重新训练所述分类器后,通过所述分类器从所述原始结构化数据集中筛选出熵值靠前的若干第一样本,并掩蔽每个所述第一样本中特征重要性分值靠前的若干关键字段后,对各所述第一样本进行补全操作,获得补全数据集;所述增强样本获取模块,用于每次迭代更新过程中得到所述补全数据集后,从所述补全数据集中筛选出KL散度小于预设阈值的补全样本作为所述增强样本,以通过所有所述增强样本更新当前迭代的所述训练数据集;所述补全数据集获取模块,还包括:重要性分析单元、重要性分值计算单元以及关键字段筛选单元;所述补全数据集获取模块,用于掩蔽每个所述第一样本中特征重要性分值靠前的若干关键字段,包括:所述重要性分析单元,用于将所述第一样本输入至所述分类器,对所述第一样本中的各第一字段进行重要性分析,获得各第一字段的重要性指标;所述重要性分值计算单元,用于根据所述重要性指标,计算各所述第一字段的特征重要性分值;所述关键字段筛选单元,用于将特征重要性分值靠前的若干第一字段作为所述若干关键字段。
8.一种终端设备,其特征在于,包括处理器、存储器以及存储在所述存储器中且被配置为由所述处理器执行的计算机程序,所述处理器执行所述计算机程序时实现如权利要求1至6任意一项所述的一种结构化数据增强方法。
9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质包括存储的计算机程序,其中,在所述计算机程序运行时控制所述计算机可读存储介质所在设备执行如权利要求1至6中任意一项所述的一种结构化数据增强方法。