1.一种基于生成对抗网络的数据脱敏方法,其特征在于包括以下步骤,A、设置生成对抗网络,将判别器节点部署在存储原始数据的设备中,将生成器节点部署在需要使用上述数据的设备中;生成对抗网络包括生成器和判别器;首先根据输入z产生相应的数据,其中 是带有参数 和输入z的生成器模型,为多层感知器或卷积神经网络,输入z通常是随机变量,当需要生成一批数据 时,输入z是n维向量;然后,将生成的数据集 与实际数据集 混合,作为判别器模型的输入集 ,判别器从X中获取任何元素x,以判断x是否属于 ;其中 是具有参数 和输入x的生成器模型,该模型是多层感知器或卷积神经网络, 是数据x的有效性,当判别器确信x属于 时,v=1,否则v=0;B、对判别器节点和生成器节点进行本地更新;C、对判别器节点进行聚合;D、对生成对抗网络进行迭代训练;E、将原始数据输入训练后的生成对抗网络,得到和原始数据特征一致但不涉及用户隐私的脱敏数据。
2.如权利要求1所述的基于生成对抗网络的数据脱敏方法,其特征在于:生成器的优化目标是最小化 ,判别器的优化目标是最大化 ,目标函数为,其中 是凹的递增函数,对应于生成对抗网络的不同变体; 为期望函数,即 为判别器认为 是真实数据的概率期望, 为判别器认为生成器生成的数据不是真实数据的期望;当判别器模型最佳时,对于一批数据 ,判别结果将满足 ,当生成器模型最佳时,生成的数据 将具有与实际数据 相同的特性;利用目标函数,调整生成器和判别器的参数,以将其损失降至最低,判别器和生成器的损失函数如下:其中 是生成的数据集,而 是实际数据集, 的元素数为n, 的元素数为m, ;使用 作为带有优化方法的一轮训练生成器或判别器,其中 是生成的数据 和实际数据 的混合,v是通过判别器传播的判别结果,并且 ; 和 分别对应第t次迭代训练时,生成器和判别器模型的参数。
3.如权利要求2所述的基于生成对抗网络的数据脱敏方法,其特征在于:判别器节点的参数线性收敛到 , ,当使用步长 时,其中 是第t次迭代的 中的信息损失系数压缩率 , 表示 范数, 用于测量压缩算子 的信息损失, 为下降率, 和 为最大值, 是判别器节点参数的平均值 , 是第j个判别器节点, 为第j个判别器节点在第T次迭代时的参数,有如下关系式 。
4.如权利要求1所述的基于生成对抗网络的数据脱敏方法,其特征在于:步骤B中,每个生成器用一个随机数z作为输入,输出生成的数据 和生成数据所对应的中间变量 ;每个生成器节点,估计和邻居判别器节点之间的通信带宽;每个生成器节点按照最小通信带宽对所生成的数据 和生成数据所对应的中间变量 进行压缩,并发送给邻居判别器节点。
5.如权利要求4所述的基于生成对抗网络的数据脱敏方法,其特征在于:步骤B中,每个判别器节点接收来自邻居生成器节点的被压缩的生成的数据 和生成数据所对应的中间变量 ;将判别器本地对的真实数据 以和生成器生产数据 相同的方式进行压缩,并将两者以相同规模混合;将混合后的数据作为输入,依次输入判别器模型,对判别器模型训练;判别器模型对压缩后的 进行判别,得到对应的判别结果 ,i表示生成数据对应的生成器节点i,j表示判别这个数据的判别器节点j;判别器把对应的判别结果 发给邻居生成器节点;生成器节点将收到的所有 进行平均,得到 ;把 作为输入,对本地模型参数进行更新。
6.如权利要求5所述的基于生成对抗网络的数据脱敏方法,其特征在于:步骤C中,每个判别器节点把自己的判别器模型梯度根据带宽自适应压缩后,广播给邻居的判别器节点;在完成广播后,每个判别器节点把收到的所有邻居的判别器模型梯度和自己的梯度进行平均,并按照权值γ和本地模型参数进行加和。
7.如权利要求6所述的基于生成对抗网络的数据脱敏方法,其特征在于:步骤D中,生成器和判别器每依次进行若干次步骤B和一次步骤C后为一轮迭代。