1.一种多任务端到端的无人机巡航与编队维持方法,其特征在于,包括以下步骤:步骤1,获取无人机及环境信息,输入动态编队控制模块,用以控制无人机群在飞行过程中保持预定的编队行进以规避障碍物;步骤2,根据动态环境的变化,由自适应策略模块计算并实时输出无人机的飞行策略和路径规划;步骤3,每一架无人机独立处理局部环境信息,确保无人机集群的全局协调;步骤4,无人机按照最终生成的决策信号进行无人机的巡航和编队维持;所述的动态编队控制模块根据合成势场进行无人机运动更新,所述的合成势场的总合力计算公式为:F total (q)=F att (q)+∑F rep (q)+∑F drone (q),其中,F total (q)为总合力,用以指导无人机的运动方向和速度,∑表示对所有相关对象进行求和,F att (q)表示引力矢量,指向目标位置,其计算公式为:F att (q)=-k att (q-q goal ),q表示当前无人机的位置向量,q goal 表示目标位置向量,k att 为引力系数,表示引力的强度,F rep (q)表示斥力矢量,指向远离障碍物的方向,其计算公式为:其中,ρ(q)表示无人机到障碍物的距离,ρ 0 为斥力影响范围,斥力作用的最大距离,k rep 为斥力系数,表示斥力的强度, 表示距离函数的梯度,方向为从障碍物指向无人机,F drone (q)表示无人机间的斥力矢量,计算公式为:其中,d(q)表示当前无人机与其他无人机的距离,d 0 表示无人机间的安全距离,k drone 为无人机间斥力系数, 表示距离函数的梯度,方向为从其他无人机指向当前无人机。
2.根据权利要求1所述的一种多任务端到端的无人机巡航与编队维持方法,其特征在于,所述的自适应策略模块包括以下步骤:结合多任务学习的特征,获取当前状态S t 并处理输入:S t =MTL(X t ,E t ,P t )其中,X t 为无人机自身状态,E t 为环境信息,P t 为任务优先级;基于当前状态S t 和优先级信息,调整策略选择的权重: 其中,λ为调整系数,P t 为任务优先级,W为权重矩阵,A t 表示当前时刻的最优动作,A表示可选动作集,Q表示动作价值函数;使用Q学习算法,结合未来的折扣奖励,更新动作价值函数Q:Q(S t , 其中,α为学习率,γ为折扣因子,用于衡量未来奖励的重要性,A ′ 表示下一时刻可能的动作,Q(S t ,A t )为动作价值函数,表示在状态S t 下执行动作A t 所能获得的预期总奖励,R t 表示即时奖励;利用多任务学习优化后的策略网络,通过梯度下降法更新策略网络参数,以最小化策略选择的损失函数: 其中,θ为策略网络参数,η为学习率, 表示梯度, 为损失函数,损失函数的计算公式为:其中, 表示期望。
3.根据权利要求2所述的一种多任务端到端的无人机巡航与编队维持方法,其特征在于,步骤3中所述的无人机独立处理局部环境信息包括以下步骤:无人机i通过传感器感知自身及邻近环境信息,并与邻近无人机交换信息,形成局部环境信息集合L i 和邻近无人机信息集合N i ;无人机i基于局部环境信息集合L i 和邻近无人机的信息集合N i ,独立计算最优决策D i ,计算公式为: 其中,A i 为无人机i可执行的动作集合,Q(L i ,A i ,N i )为动作价值函数,表示在局部信息L i 和邻近无人机信息N i 下执行动作A i 所能获得的预期总奖励;通过与邻近无人机的通信和信息交换,确保无人机i的决策D i 与其邻近无人机的决策在全局目标上保持一致性,避免决策冲突,D′ i =Cooperate(D i ,D neighbors ),其中,D neighbors 为邻近无人机的决策集合,Cooperate为协同函数,用于调整决策以避免冲突,D′ i 为协同之后的局部决策。
4.根据权利要求2所述的一种多任务端到端的无人机巡航与编队维持方法,其特征在于,步骤3中所述的无人机独立处理局部环境信息包括以下步骤:将感知到的局部环境信息集合L i 和邻近无人机的信息集合N i 进行融合,生成局部状态表示,并提取关键特征V i ,V i =f fusion (L i ,N i )其中,f fusion 表示特征融合函数,提取的关键特征V i 作为后续决策的输入;根据实时环境和任务的重要性,动态调整任务的优先级,生成任务权重W i ,以确保关键任务得到优先处理;利用强化学习算法计算每个动作在当前局部状态下的价值Q(V i ,A i ,W i ),Q(V i ,A i ,W i )=RL(V i ,A i ,W i ),其中,RL表示强化学习模型,通过训练生成的Q值函数对每个可能的动作进行价值评估;根据计算的Q值,选择价值最高的动作作为当前的最优决策D i , 这一步骤确保无人机能够在当前状态下做出收益最大的决策,A i 为无人机i可执行的动作集合,Q(V i ,A i ,W i )为动作价值函数,表示在特征向量V i 和任务权重W i 下执行动作A i 所能获得的预期总奖励;通过与邻近无人机的信息交换,协调和调整决策,避免决策冲突,确保无人机群体行为的一致性:D‘ i =Cooperate(D i ,D neighbors ),其中,D neighbors 为邻近无人机的决策集合,Cooperate为协同函数,D′ i 为协同之后的局部决策,通过协同机制对决策进行微调,使无人机群体中的个体行为相互兼容。
5.根据权利要求3或4所述的一种多任务端到端的无人机巡航与编队维持方法,其特征在于,所述的协同函数用以实现决策一致性调整,包括以下步骤:无人机i从邻近无人机处收集更新后的决策信息,形成完整的决策信息矩阵;对决策信息矩阵进行分析,计算每对无人机之间的决策一致性误差E i ,即在相同时间步下各无人机的路径点之间的偏差,其计算公式为:E i (j,k)=‖P j ′ (t)-P ′ k (t)‖,其中,P j ′ (t)和P ′ k (t)表示无人机j和k在时间步t的调整后路径点,如果误差大于某个预设的容忍阈值e tol ,则认为存在一致性问题;对于每个存在一致性误差的无人机对j和k,计算一致性调整向量ΔP ij ,以最小化路径的偏差,一致性调整向量的计算公式为:其中,α为调整系数,控制调整的幅度;将一致性调整向量应用于相应的无人机,更新它们的路径,以减少全局上的一致性误差,更新公式为:其中, 表示与无人机i相邻的无人机集合,最终的决策输出为调整后的路径P i ″ 。