有效
多无人机辅助移动边缘计算轨迹优化方法、装置和设备
张淼、彭勇、张秀铃、孙佳楠、尹路珈、石超、王吉、陈海亮
中国人民解放军国防科技大学
摘要
本发明涉及一种多无人机辅助移动边缘计算轨迹优化方法、装置和设备,首先构建多个模型,具体为:用户关联模型,用于定义无人机和计算任务间的对应关系;无人机移动模型,用于约束无人机和用户位置的位置并避免无人机相撞;任务计算模型,用于计算任务执行时间;无人机能耗模型,用于约束无人机能耗。接着在上述模型的基础上构建无人机的深度强化学习模型,分别定义局部观测、全局观测、动作、奖励等参数含义,其中,根据无人机的移动角度和距离定义动作,根据任务执行总时间和任务响应失败率等定义奖励函数,最大化奖励函数以实现无人机的轨迹优化。采用本方法能够找到具有最小任务完成时间和任务请求失败率的卸载决策和移动轨迹。
1.一种多无人机辅助移动边缘计算轨迹优化方法,其特征在于,所述方法包括:构建用户关联模型;所述用户关联模型是指无人机和用户设备要卸载的计算任务之间的对应关系;在所述用户关联模型中限定在每个时隙中:每架无人机最多接受其覆盖范围内的预设数量的计算任务、每个计算任务只能由无人机或者用户设备执行,以及每个用户设备最多产生一个计算任务请求;构建无人机移动模型;所述无人机移动模型限制无人机和用户设备在一个预设区域内以及任意两架无人机之间的最小距离;构建任务计算模型;所述任务计算模型用于计算每个时隙中各个计算任务的任务计算时间;构建无人机能耗模型;所述无人机能耗模型用于限制每架无人机在整个服务周期内的总能耗;基于所述用户关联模型、所述无人机移动模型、所述构建任务计算模型以及所述无人机能耗模型,构建无人机的深度强化学习模型,具体为:将无人机的自身状态、当前所执行计算任务的信息以及其覆盖范围内的其他无人机与其之间的相对距离定义为局部观测;其中,无人机的自身状态包括:无人机的位置、剩余能量以及空闲资源;将预设区域内的环境中所有无人机的局部观测的聚合信息定义为全局观测;将无人机在单位时隙中的飞行角度和飞行距离定义为动作;根据任务计算总时间、计算任务请求响应失败率以及无人机移动模型中的限制来构建奖励函数;任务请求响应失败是指任务计算时间超过相应计算任务请求的最大容忍时间;以最大化所述奖励函数为目标,对无人机移动轨迹进行优化;在训练阶段,首先从经验缓冲区采样训练数据;所述训练数据包括:当前时隙的全局观测、当前时隙无人机的局部观测、当前时隙无人机执行的动作及其执行动作后获得的奖励、下一时隙的全局观测以及下一时隙无人机的局部观测;将当前时隙无人机的局部观测输入Actor网络中,输出下一时隙无人机的动作,即飞行角度和飞行距离,以此更新无人机的位置;利用Critic网络评估每个无人机状态的价值,用于计算优势值;Critic网络除了输入层和输出层之外和Actor网络的网络架构相同;利用优势值更新Actor网络和Critic网络,最终得到训练好的Critic网络和Actor网络;在执行阶段,每个无人机根据训练好的Actor网络输出的动作与环境交互;优势值的计算方式如下: ;其中, 表示在时隙t的优势值, 为在时隙t的时序差分误差,定义为:其中 是在时隙t的即时奖励, 是折扣因子,范围在[0,1]之间, 和 是全局观测 和 的值函数, 是GAE参数,范围也在[0,1]之间, 是衰减因子,表示随着时间的推移,未来的时序差分误差对当前优势值的影响会逐渐减小。
2.根据权利要求1所述的方法,其特征在于,所述计算每个时隙中各个计算任务的任务计算时间包括:1)若当前时隙中,用户设备中的计算任务卸载到无人机上执行,即进行卸载计算,则任务计算时间的计算方式如下:获取用户设备的计算任务上传速率: ;其中, 表示第 个用户设备在时隙 将其计算任务中的数据上传到第 架无人机上的速率, 表示信道带宽, = / , ≈2.2846,g 0 表示参考距离为1m时信道的功率增益, 表示噪声功率, 表示第 架无人机的高度,为固定值, 表示第 个用户设备的发射功率, 表示第 个用户设备和第 架无人机在时隙 的距离, 表示一个服务周期;根据用户设备的计算任务上传速率计算用户设备的计算任务卸载时间: ;其中, 表示第 个用户设备在时隙 将其计算任务中的数据卸载到第 架无人机上所需的时间, 表示第 个用户设备在时隙 的计算任务的数据量;根据用户设备上计算任务的执行所需CPU周期数计算无人机的计算任务执行时间: ;其中, 表示第 个用户设备在时隙 将其计算任务中的数据卸载到第 架无人机后,无人机执行该计算任务所需的时间, 表示第 个用户设备在时隙 的计算任务的执行所需CPU周期数, 表示第 架无人机在时隙 能够分配给第 个用户设备的计算资源;根据所述用户设备的计算任务卸载时间和所述无人机的计算任务执行时间之和得到任务计算时间;2)若当前时隙中,用户设备中的计算任务由自身执行,即进行本地计算,则任务计算时间的计算方式如下: ;其中, 表示第 个用户设备在时隙 进行本地计算所需时间。
3.根据权利要求1所述的方法,其特征在于,无人机的能耗包括飞行能耗、悬停能耗以及计算能耗;其中:飞行能耗计算方式如下: ;其中, 表示第 架无人机在时隙 的飞行能耗, 表示从 点到 点的距离, 表示第 架无人机单位距离的飞行功率;悬停能耗计算方式如下: ;其中, 表示第 架无人机在时隙 的悬停能耗, 表示第 架无人机在时隙 的悬停时间,由用户设备的计算任务卸载时间 和无人机的计算任务执行时间 组成, 表示第 架无人机单位时间的悬停功率;计算能耗计算方式如下: ;其中, 表示第 架无人机在时隙 的计算能耗, 表示有效开关电容, 表示第 架无人机在时隙 执行第 个用户设备卸载的计算任务的CPU功率, 表示第 个用户设备在时隙 的计算任务的执行所需CPU周期数;所述限制每架无人机在整个服务周期内的总能耗,具体为: ;其中, 表示第 架无人机在整个服务周期内的总能耗, 表示无人机的机载能量限制。
4.根据权利要求1所述的方法,其特征在于,根据任务计算总时间、计算任务请求响应失败率以及无人机移动模型中的限制来构建奖励函数为: , ; ; ;其中, 表示在时隙 所有无人机获得的奖励, 表示第 架无人机在时隙 获得的奖励, 表示第 架无人机与其它无人机发生碰撞或飞出预设区域时触发的惩罚项, 表示奖励的权重参数, 表示惩罚项的权重参数, 表示时隙 的计算任务请求响应失败率, 表示计算任务的总数, 表示时隙 的计算任务请求响应失败数量, 表示第 个用户设备在时隙 将其计算任务中的数据卸载到第 架无人机以及第 架无人机执行该计算任务所需的总时间。
5.根据权利要求1所述的方法,其特征在于,所述Actor网络的损失函数为: ;其中, 表示Actor网络的参数, 表示新旧策略的比值, 表示在时隙t的优势值, 表示PPO的剪切范围, 表示熵奖励的权重, 表示优化的策略, 表示在状态 下执行动作 的概率。
6.根据权利要求1所述的方法,其特征在于,所述Critic网络的损失函数为: ;其中, 表示Critic网络的参数, 表示使用当前参数 的Critic网络对状态 的价值估计, )表示t+1时刻的状态值函数的折扣值。
7.一种多无人机辅助移动边缘计算轨迹优化装置,其特征在于,所述装置包括:用户关联模型构建模块,用于构建用户关联模型;所述用户关联模型是指无人机和用户设备要卸载的计算任务之间的对应关系;在所述用户关联模型中限定在每个时隙中:每架无人机最多接受其覆盖范围内的预设数量的计算任务、每个计算任务只能由无人机或者用户设备执行,以及每个用户设备最多产生一个计算任务请求;无人机移动模型构建模块,用于构建无人机移动模型;所述无人机移动模型限制无人机和用户设备在一个预设区域内以及任意两架无人机之间的最小距离;任务计算模型构建模块,用于构建任务计算模型;所述任务计算模型用于计算每个时隙中各个计算任务的任务计算时间;无人机能耗模型构建模块,用于构建无人机能耗模型;所述无人机能耗模型用于限制每架无人机在整个服务周期内的总能耗;深度强化学习模型构建模块,用于基于所述用户关联模型、所述无人机移动模型、所述构建任务计算模型以及所述无人机能耗模型,构建无人机的深度强化学习模型,具体为:将无人机的自身状态、当前所执行计算任务的信息以及其覆盖范围内的其他无人机与其之间的相对距离定义为局部观测;其中,无人机的自身状态包括:无人机的位置、剩余能量以及空闲资源;将预设区域内的环境中所有无人机的局部观测的聚合信息定义为全局观测;将无人机在单位时隙中的飞行角度和飞行距离定义为动作;根据任务计算总时间、计算任务请求响应失败率以及无人机移动模型中的限制来构建奖励函数;任务请求响应失败是指任务计算时间超过相应计算任务请求的最大容忍时间;无人机移动轨迹优化模块,用于以最大化所述奖励函数为目标,对无人机移动轨迹进行优化;在训练阶段,首先从经验缓冲区采样训练数据;所述训练数据包括:当前时隙的全局观测、当前时隙无人机的局部观测、当前时隙无人机执行的动作及其执行动作后获得的奖励、下一时隙的全局观测以及下一时隙无人机的局部观测;将当前时隙无人机的局部观测输入Actor网络中,输出下一时隙无人机的动作,即飞行角度和飞行距离,以此更新无人机的位置;利用Critic网络评估每个无人机状态的价值,用于计算优势值;Critic网络除了输入层和输出层之外和Actor网络的网络架构相同;利用优势值更新Actor网络和Critic网络,最终得到训练好的Critic网络和Actor网络;在执行阶段,每个无人机根据训练好的Actor网络输出的动作与环境交互;优势值的计算方式如下: ;其中, 表示在时隙t的优势值, 为在时隙t的时序差分误差,定义为:其中 是在时隙t的即时奖励, 是折扣因子,范围在[0,1]之间, 和 是全局观测 和 的值函数, 是GAE参数,范围也在[0,1]之间, 是衰减因子,表示随着时间的推移,未来的时序差分误差对当前优势值的影响会逐渐减小。
8.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至6中任一项所述方法的步骤。



