有效
一种无人机追逃与避障方法、装置、设备及介质
肖学明、何浩源、付跃刚、桂云霆、刘洺州
长春理工大学
摘要
本申请公开了一种无人机追逃与避障方法、装置、设备及介质,涉及人工智能技术领域,包括:基于无人机坐标和被追踪目标的坐标确定目标信息;将目标信息整合为第一状态空间,将第一状态空间输入基于第一奖励函数训练的强化学习算法,得到下一时刻无人机的预测位置与被追踪目标之间的第二水平角和下一时刻无人机的偏航角;确定障碍物在无人机前方的角度范围,基于角度范围、第二水平角、当前无人机的偏航角、下一时刻无人机的偏航角和第一水平角构建第二状态空间;将第二状态空间输入基于第二奖励函数训练的强化学习算法,以确定无人机的待执行动作,以便无人机根据待执行动作完成追逃与避障。实现了无人机在追踪目标或逃逸的同时能够实时规避障碍。
1.一种无人机追逃与避障方法,其特征在于,包括:获取无人机坐标和被追踪目标的坐标,基于所述无人机坐标和被追踪目标的坐标确定目标信息;所述目标信息包括所述被追踪目标与无人机之间的距离、垂直角、第一水平角和当前所述无人机的偏航角;将所述目标信息整合为第一状态空间,将所述第一状态空间输入至基于第一奖励函数训练的强化学习算法,以得到下一时刻所述无人机的预测位置与所述被追踪目标之间的第二水平角和下一时刻所述无人机的偏航角;所述第一奖励函数为基于水滴形势能场的势能变化确定的奖励函数;确定障碍物在所述无人机前方的角度范围,基于所述角度范围、所述第二水平角、当前所述无人机的偏航角、下一时刻所述无人机的偏航角和所述第一水平角构建第二状态空间;将所述第二状态空间输入至基于第二奖励函数训练的强化学习算法,以确定所述无人机的待执行动作,以便所述无人机根据所述待执行动作完成追逃与避障;所述待执行动作包括用于控制无人机在目标平面内的前向机动的水平速度幅值、用于实现爬升或下降的竖直方向速度以及偏航角速度;所述第二奖励函数为基于当前所述无人机的偏航角和下一时刻所述无人机的偏航角之间的偏差指数衰减确定的奖励函数。
2.根据权利要求1所述的无人机追逃与避障方法,其特征在于,所述获取无人机坐标和被追踪目标的坐标,包括:通过无人机自身传感器和卫星获取无人机坐标和被追踪目标的坐标。
3.根据权利要求1所述的无人机追逃与避障方法,其特征在于,所述将所述第一状态空间输入至基于第一奖励函数训练的强化学习算法之前,还包括:若所述被追踪目标在所述无人机的正面扇形区,则确定第一水滴形势场的表达式;若所述被追踪目标在所述无人机的后方扇形区,则确定第二水滴形势场的表达式;根据所述第一水滴形势场的表达式确定极坐标形式下的第三水滴形势场的表达式;根据所述第二水滴形势场的表达式确定极坐标形式下的第四水滴形势场的表达式;根据所述第三水滴形势场的表达式和所述第四水滴形势场的表达式确定当前相对方位下水滴势场沿该方向的场半径;通过预设视线在机头方向上的分量确定公式基于所述第一水平角和所述垂直角确定视线在机头方向上的分量;通过预设侧向权确定公式基于视线在机头方向上的分量确定侧向权;基于所述侧向权确定基于第一奖励函数训练的强化学习算法;其中,所述第一水滴形势场的表达式为: ;所述第二水滴形势场的表达式为: ;所述第三水滴形势场的表达式: ;所述第四水滴形势场的表达式: ;其中, ; ; ; ; ; ; ;其中, 为侧向二次项权重; 为耦合系数; 为水滴沿x轴的轴向位移/偏置; 为极小正则量; 为所述第一水平角; 为所述垂直角;r为当前相对方位下水滴势场沿该方向的场半径;所述预设视线在机头方向上的分量确定公式为: ;其中, 为视线在机头方向上的分量;所述预设侧向权确定公式为: ;其中, 为所述侧向权; 为无量纲的常数。
4.根据权利要求3所述的无人机追逃与避障方法,其特征在于,所述基于所述侧向权确定基于第一奖励函数训练的强化学习算法,包括:确定头朝向距离向量与所述场半径之间的目标比值,将所述目标比值与所述侧向权的乘积确定为归一化场距离向量;将预设比例系数与所述归一化场距离向量之间的比值确定为不同时刻的势能;基于不同时刻的势能确定水滴场的径向距离;基于所述径向距离确定奖励函数优化策略,基于所述奖励函数优化策略确定第一奖励函数,并利用所述第一奖励函数对强化学习算法进行训练,以得到基于第一奖励函数训练的强化学习算法。
5.根据权利要求4所述的无人机追逃与避障方法,其特征在于,所述基于不同时刻的势能确定水滴场的径向距离,包括:基于预设折扣因子与当前时刻的势能的乘积和上一时刻的势能之间的差值确定水滴场的径向距离。
6.根据权利要求1所述的无人机追逃与避障方法,其特征在于,所述确定障碍物在所述无人机前方的角度范围,包括:通过激光雷达传感器探测环境,以确定环境中的各障碍物的方位信息;通过基于密度的聚类分析算法对各障碍物的方位信息进行处理,以确定障碍物在所述无人机前方的角度范围。
7.根据权利要求1至6任一项所述的无人机追逃与避障方法,其特征在于,所述将所述第二状态空间输入至基于第二奖励函数训练的强化学习算法之前,还包括:若所述无人机发生碰撞,则根据预设碰撞惩罚奖励确定第二奖励函数;若所述无人机与被追踪目标之间的距离小于预设距离,则根据预设目标达成奖励、预设步数惩罚系数和时间步长确定所述第二奖励函数;若所述无人机的时间步长大于预设时间步长,则基于预设超时惩罚奖励确定所述第二奖励函数;否则,基于所述当前所述无人机的偏航角和下一时刻所述无人机的偏航角确定所述第二奖励函数;根据所述第二奖励函数确定基于第二奖励函数训练的强化学习算法。
8.一种无人机追逃与避障装置,其特征在于,包括:目标信息确定模块,用于获取无人机坐标和被追踪目标的坐标,基于所述无人机坐标和被追踪目标的坐标确定目标信息;所述目标信息包括所述被追踪目标与无人机之间的距离、垂直角、第一水平角和当前所述无人机的偏航角;水平角和偏航角确定模块,用于将所述目标信息整合为第一状态空间,将所述第一状态空间输入至基于第一奖励函数训练的强化学习算法,以得到下一时刻所述无人机的预测位置与所述被追踪目标之间的第二水平角和下一时刻所述无人机的偏航角;所述第一奖励函数为基于水滴形势能场的势能变化确定的奖励函数;状态空间构建模块,用于确定障碍物在所述无人机前方的角度范围,基于所述角度范围、所述第二水平角、当前所述无人机的偏航角、下一时刻所述无人机的偏航角和所述第一水平角构建第二状态空间;待执行动作确定模块,用于将所述第二状态空间输入至基于第二奖励函数训练的强化学习算法,以确定所述无人机的待执行动作,以便所述无人机根据所述待执行动作完成追逃与避障;所述待执行动作包括用于控制无人机在目标平面内的前向机动的水平速度幅值、用于实现爬升或下降的竖直方向速度以及偏航角速度;所述第二奖励函数为基于当前所述无人机的偏航角和下一时刻所述无人机的偏航角之间的偏差指数衰减确定的奖励函数。
9.一种电子设备,其特征在于,包括:存储器,用于存储计算机程序;处理器,用于执行计算机程序以实现如权利要求1至7任一项所述的无人机追逃与避障方法。
10.一种计算机可读存储介质,其特征在于,计算机可读存储介质上存储有计算机程序,计算机程序被处理器执行时实现如权利要求1至7任一项所述的无人机追逃与避障方法。



