1.一种基于差分隐私图像加噪的联邦学习模型训练方法,其特征在于,包括:S1:初始化评估网络、目标网络以及相关超参数;S2:在中央服务器初始化联邦学习系统的全局模型及其参数,并将所述全局模型广播至所有客户端;S3:根据联邦学习系统的当前状态以及目标网络,获取选定的客户端以及分配的隐私预算;S4:在所述选定的客户端利用本地数据集对本地模型进行训练,并将扰动梯度上传至所述中央服务器;S5:在所述中央服务器对来自选定的客户端的扰动梯度进行聚合,获得更新后的全局模型以及当前状态对应的奖励;S6:对所述评估网络和目标网络进行更新;S7:重复执行S3至S6,直至到达一次联邦学习设定的全局迭代次数 n ;S8:对探索率进行更新并重复执行S2至S7,直至达到设定的联邦学习次数 E ,所述S1包括:S1.1:将评估网络 的参数 以及目标网络 的参数 随机初始化为相等的参数;S1.2:初始化相关超参数,所述相关超参数包括折扣因子 、软更新参数 、探索率 、探索率最小值 、探索率衰减因子 、评估网络学习率 以及重放缓冲区 ,所述S3包括:在(0,1)范围内随机产生一个小数,将所述小数的值与探索率 的值进行比较;若所述小数的值小于探索率 的值,则随机生成本次联邦学习中第 次全局迭代的动作 ,其中, 表示客户端 在第 次全局迭代中是否被选中,若是,则 ,否则 , 表示客户端 在第 次全局迭代中被分配的隐私预算, 表示客户端的集合;若所述小数的值大于或等于探索率 ,将当前状态 输入至所述目标网络 中,所述目标网络 根据所述当前状态输出多个概率,所述概率的数量与所述动作的数量相等,利用Top-k技术选择最大的前 个概率对应的动作 ,将当前动作 对应的客户端作为选定的客户端,其中, 表示客户端 在第 次全局迭代中的本地损失函数值, 表示客户端 在第 次全局迭代中剩余的总体隐私预算。
2.根据权利要求1所述的基于差分隐私图像加噪的联邦学习模型训练方法,其特征在于,所述S4包括:S4.1:所述选定的客户端获取当前的全局模型 以及分配的隐私预算 ,并将所述全局模型 的参数赋值给所述本地模型;S4.2:从本地图像训练数据集中选择预定数量的本地图像训练数据,根据分配的隐私预算 利用高斯机制生成对应程度的差分隐私噪声并添加至所述本地图像训练数据中,获得加噪后的本地图像训练数据: ;其中, 表示当前的本地图像训练数据中第 m 行第 n 列的像素值, 表示加噪后的本地图像训练数据中第 m 行第 n 列的像素值, 表示满足均值为0、方差为 的高斯分布的高斯噪声;S4.3:利用所述加噪后的本地图像训练数据对当前客户端上的本地模型 进行训练,得到本地损失值 和对应的扰动梯度 ,并将所述扰动梯度 上传至所述中央服务器;S4.4:所述客户端根据所述分配的隐私预算 获得当前的剩余总体隐私预算 : ;其中, 表示客户端 的初始总体隐私预算, 表示客户端 在第 m 次全局迭代中分配的隐私预算。
3.根据权利要求2所述的基于差分隐私图像加噪的联邦学习模型训练方法,其特征在于,所述S5包括:S5.1:所述中央服务器对来自所有选定的客户端的扰动梯度进行聚合,获得更新后的全局模型 : ;其中, 表示第 次全局迭代中的全局模型, 表示第t次全局迭代中的全局模型, 为学习率, 表示所选择的客户端中本地图像训练数据的总数, 表示第 个客户端的本地图像训练数据的数量, 表示选定的客户端的数量;S5.2:所述中央服务器获取当前状态对应的奖励: ;其中, , 为固定超参数, 为比例系数。
4.根据权利要求3所述的基于差分隐私图像加噪的联邦学习模型训练方法,其特征在于,所述S6包括:S6.1:将联邦学习系统切换到下一个状态 并将元组 存储至所述重放缓冲区 中,其中, 分别表示联邦学习系统执行第 次全局迭代的状态、动作和奖励, 表示联邦学习系统执行第 次全局迭代的状态;S6.2:从所述重放缓冲区 中随机抽取 b 个元组 作为样本,并根据折扣因子 和评估网络学习率 利用随机梯度下降法对所述评估网络 的参数进行训练更新,获得更新后的评估网络;S6.3:根据软更新原理对目标网络的参数进行更新: 。
5.根据权利要求4所述的基于差分隐私图像加噪的联邦学习模型训练方法,所述S6.2包括:判断所述重放缓冲区 中存储的元组 的数量是否大于或等于预设的抽取数量 b ,若是,则从所述重放缓冲区 中随机抽取 b 个元组 作为样本,并根据折扣因子 和评估网络学习率 利用随机梯度下降法对所述评估网络 的参数进行训练更新,获得更新后的评估网络;若否,则保持所述评估网络 的参数不变。
6.根据权利要求1所述的基于差分隐私图像加噪的联邦学习模型训练方法,其特征在于,对探索率进行更新,包括:在进行完一次联邦学习中的 n 次全局迭代之后,判断探索率 是否达到预设的探索率最小值 ,若是,则保持探索率 不变,若否,则利用探索率衰减因子 对探索率 进行更新,获得更新后的探索率: ;其中, 表示更新后的探索率。
7.一种基于差分隐私图像加噪的联邦学习模型训练系统,其特征在于,包括中央服务器和连接至所述中央服务器的多个客户端,用于执行权利要求1至6中任一项所述的基于差分隐私图像加噪的联邦学习模型训练方法。