1.一种自适应边缘联邦学习客户端调度方法,其特征在于,应用于服务器,包括:初始化生成结构相同的第一神经网络与第二神经网络;令t=1,获取客户端在第t轮训练时的状态向量集合S t ,所述状态向量集合S t 包括各个客户端在第t轮训练时的状态向量;所述各个客户端在第t轮训练时的状态向量为: ,其中, 表示第 个客户端, 表示计算能力, 表示网络信号强度, 表示本地数据的数据量大小, 表示本地数据的异质性程度, 表示电池状态;将所述状态向量集合S t 输入至所述第一神经网络,通过第一神经网络预测客户端在第t轮训练时的动作向量集合a t ,所述动作向量集合a t 包括各个客户端在第t轮训练时的动作向量;所述各个客户端在第t轮训练时的动作向量为: ,其中, 表示客户端 在第t轮训练时的最优训练轮数, 表示客户端 是否参与第t轮训练, 时表示客户端 利用本地数据对待训练的全局模型进行第t轮训练, 时表示客户端 不参与第t轮训练;将待训练的全局模型广播至各个客户端后,以使各客户端基于自身对应的动作向量和本地数据对所述待训练的全局模型进行训练,得到本地模型;获取多个所述本地模型的参数并聚合,得到新的全局模型;判断所述新的全局模型的当前精度是否满足预设条件;若是,则将所述新的全局模型作为训练完成的全局模型;反之,则令t=t+1,使用所述第二神经网络、随机采样得到的经验(S i ,a i , r i , S i+1 )及预设损失函数计算第一神经网络的损失值,并根据所述损失值调整所述第一神经网络的参数后,根据t的取值更新所述第二神经网络,并将所述新的全局模型作为待训练的全局模型、将客户端第t+1轮训练时的状态向量集合S t+1 输入至所述第一神经网络以筛选参与第t+1轮训练的客户端后,返回所述将待训练的全局模型广播至各个客户端的步骤,直至每轮训练时聚合得到的新的全局模型的当前精度满足预设条件;其中r i 表示第i轮训练后的奖励;初始化生成结构相同的第一神经网络与第二神经网络的步骤之后,还包括:初始化回放缓存;当所述新的全局模型的当前精度不满足预设条件时,使用所述第二神经网络、随机采样得到的经验(S i ,a i , r i , S i+1 )及预设损失函数计算第一神经网络的损失值的步骤之前,还包括:计算第t轮训练的奖励r t ;在获取客户端第t+1轮训练时的状态向量集合S t+1 后,将经验(s t ,a t ,r t ,s t+1 )存入所述回放缓存;按照如下公式计算第t轮训练时的奖励r t : ;其中, 表示第t轮训练后新的全局模型的当前精度, 表示预设精度, 表示客户端 在第t轮训练中消耗的能量, 表示预设权重系数, 表示与参与第t轮训练的客户端总数;当所述新的全局模型的当前精度不满足预设条件时,使用所述第二神经网络、随机采样得到的经验(S i ,a i , r i , S i+1 )及预设损失函数计算第一神经网络的损失值,并根据所述损失值调整所述第一神经网络的参数后,根据t的取值更新所述第二神经网络,并将所述新的全局模型作为待训练的全局模型、将客户端第t+1轮训练时的状态向量集合S t+1 输入至所述第一神经网络以筛选参与第t+1轮训练的客户端后,返回所述将待训练的全局模型广播至各个客户端的步骤,直至每轮训练时聚合得到的新的全局模型的当前精度满足预设条件的步骤,包括:从所述回放缓存中随机采样经验(s i ,a i ,r i ,s i+1 );利用所述经验(s i ,a i ,r i ,s i+1 )和所述第二神经网络,计算第i轮训练的Q值: ;其中, 表示第二神经网络的函数, 表示第二神经网络的参数, 表示使 取得最大值的动作 , 表示第i轮训练的奖励, 表示预设折扣因子;基于所述第i轮训练的Q值以及预设损失函数,计算所述第一神经网络的损失值,并根据所述损失值调整所述第一神经网络的参数;根据t的取值更新所述第二神经网络;将所述新的全局模型作为待训练的全局模型、将客户端第t+1轮训练时的状态向量集合S t+1 输入至所述第一神经网络以筛选参与第t+1轮训练的客户端;返回所述将待训练的全局模型广播至各个客户端的步骤,直至每轮训练时聚合得到的新的全局模型的当前精度满足预设条件。
2.根据权利要求1所述的自适应边缘联邦学习客户端调度方法,其特征在于,获取多个所述本地模型的参数并聚合,得到新的全局模型的步骤,包括:对客户端上传的各个本地模型的参数进行加权平均,得到新的全局模型。
3.根据权利要求1所述的自适应边缘联邦学习客户端调度方法,其特征在于,根据t的取值更新所述第二神经网络的步骤,包括:根据训练轮数t,每间隔C轮将所述第一神经网络的参数复制给所述第二神经网络。
4.一种自适应边缘联邦学习客户端调度装置,其特征在于,应用于服务器,包括:初始化模块,用于初始化生成结构相同的第一神经网络与第二神经网络;获取模块,令t=1,用于获取客户端在第t轮训练时的状态向量集合S t ,所述状态向量集合S t 包括各个客户端在第t轮训练时的状态向量;所述各个客户端在第t轮训练时的状态向量为: ,其中, 表示第 个客户端, 表示计算能力, 表示网络信号强度, 表示本地数据的数据量大小, 表示本地数据的异质性程度, 表示电池状态;输入模块,用于将所述状态向量集合S t 输入至所述第一神经网络,通过第一神经网络预测客户端在第t轮训练时的动作向量集合a t ,所述动作向量集合a t 包括各个客户端在第t轮训练时的动作向量;所述各个客户端在第t轮训练时的动作向量为: ,其中, 表示客户端 在第t轮训练时的最优训练轮数, 表示客户端 是否参与第t轮训练, 时表示客户端 利用本地数据对待训练的全局模型进行第t轮训练, 时表示客户端 不参与第t轮训练;广播模块,用于将待训练的全局模型广播至各个客户端后,以使各客户端基于自身对应的动作向量和本地数据对所述待训练的全局模型进行训练,得到本地模型;聚合模块,用于获取多个所述本地模型的参数并聚合,得到新的全局模型;判断模块,用于判断所述新的全局模型的当前精度是否满足预设条件;若是,则将所述新的全局模型作为训练完成的全局模型;反之,则令t=t+1,使用所述第二神经网络、随机采样得到的经验(S i ,a i , r i , S i+1 )及预设损失函数计算第一神经网络的损失值,并根据所述损失值调整所述第一神经网络的参数后,根据t的取值更新所述第二神经网络,并将所述新的全局模型作为待训练的全局模型、将客户端第t+1轮训练时的状态向量集合S t+1 输入至所述第一神经网络以筛选参与第t+1轮训练的客户端后,返回所述将待训练的全局模型广播至各个客户端的步骤,直至每轮训练时聚合得到的新的全局模型的当前精度满足预设条件;其中r i 表示第i轮训练后的奖励;初始化生成结构相同的第一神经网络与第二神经网络的步骤之后,还包括:初始化回放缓存;当所述新的全局模型的当前精度不满足预设条件时,使用所述第二神经网络、随机采样得到的经验(S i ,a i , r i , S i+1 )及预设损失函数计算第一神经网络的损失值的步骤之前,还包括:计算第t轮训练的奖励r t ;在获取客户端第t+1轮训练时的状态向量集合S t+1 后,将经验(s t ,a t ,r t ,s t+1 )存入所述回放缓存;其中,按照如下公式计算第t轮训练时的奖励r t : ;其中, 表示第t轮训练后新的全局模型的当前精度, 表示预设精度, 表示客户端 在第t轮训练中消耗的能量, 表示预设权重系数, 表示与参与第t轮训练的客户端总数;判断模块,当所述新的全局模型的当前精度不满足预设条件时,具体用于从所述回放缓存中随机采样经验(s i ,a i ,r i ,s i+1 );利用所述经验(s i ,a i ,r i ,s i+1 )和所述第二神经网络,计算第i轮训练的Q值: ;其中, 表示第二神经网络的函数, 表示第二神经网络的参数, 表示使 取得最大值的动作 , 表示第i轮训练的奖励, 表示预设折扣因子;基于所述第i轮训练的Q值以及预设损失函数,计算所述第一神经网络的损失值,并根据所述损失值调整所述第一神经网络的参数;根据t的取值更新所述第二神经网络;将所述新的全局模型作为待训练的全局模型、将客户端第t+1轮训练时的状态向量集合S t+1 输入至所述第一神经网络以筛选参与第t+1轮训练的客户端;返回所述将待训练的全局模型广播至各个客户端的步骤,直至每轮训练时聚合得到的新的全局模型的当前精度满足预设条件。
5.一种电子设备,其特征在于,包括处理器、通信接口、存储器和通信总线,其中,处理器、通信接口、存储器通过通信总线完成相互间的通信;存储器,用于存放计算机程序;处理器,用于执行存储器上所存放的程序时,实现权利要求1-3任一所述的方法步骤。