1.一种基于空域网格的无冲突航路规划方法,其特征在于,具体步骤如下:步骤一、飞行器部署机载平台,收集四维航迹数据,将飞行起点、终点和障碍物信息处理成动态的点迹序列,发送给航路规划模块;步骤二、航路规划模块依据每个时间片上不同的三维空间的坐标关系,构建出四维时空的空域网格;步骤三、在空域网格的基础上,依据强化学习迭代计算四维时空通行价值图;并从通行价值图中选择一条成本最小的无冲突路径,输送到路径平滑模块中;具体过程为:步骤301,定义的状态s的价值函数v(s)和回报函数r(s);价值函数v(s)定义为:飞行器从状态s出发沿着使用策略π选择的路径到达目标位置所获得的奖励的期望;策略π定义为状态s到任意可行动作a的概率的映射;回报函数r(s)的定义为:其中S obstacle 为除了当前代理外环境中其他元素的所占据的网格位置集合;S goal 为目标的网格位置;步骤302,根据四维时空的空域网格地图,遍历飞行器从每个位置出发到达目的地的路径中,使用回报函数计算各个位置的回报即通行成本,将其储存到回报图中;对于任意状态s=(t,i,j,k),回报图中的值表示在时间t处于网格位置(i,j,k)时给予的回报值;步骤303,基于回报图使用价值迭代算法计算各时刻的回报,通过多轮迭代,计算T时刻收敛的四维时空通行价值图;首先,在迭代算法的初始化阶段,将所有时刻除目标位置外的所有位置的价值均设为-∞,所有时刻的目标位置的价值设为0;N为价值迭代算法的最大输入帧数;然后,计算时,使用三维空间价值迭代算法以静态地图的方式,使用最后一帧网格地图计算T时刻的通行价值图;当最后T时刻的通行价值图收敛后,再以四维时空价值迭代方法依次计算得到T-1,T-2,…,0时刻的通行价值图,所有位置的通行价值最终均得以更新;时空价值函数按照以下公式进行更新: 步骤304,当通行价值图中每个状态的价值为最优价值的时候,即为选择的最优飞行路线路径;该路径为网格坐标组成的飞行路线控制点序列;步骤四、路线平滑模块得到成本最小的无冲突路径后,由路线平滑算法根据飞行器的物理特征与动力学特性对路线控制点序列进行平滑,最后将平滑后的结果发送到机载平台,机载平台按照该路线控制飞行器的飞行。
2.如权利要求1所述的一种基于空域网格的无冲突航路规划方法,其特征在于,所述步骤二具体构建过程为:将飞行器起点与终点作为边界生成立体目标空域,然后将立体目标空域分割为若干个四维网格,每个四维网格单元的长度、宽度及高度按照飞行器标准间隔距离进行设定,并将飞行器的航迹和障碍物的位置,按照时间片对应到设定好的四维网格当中。
3.如权利要求1所述的一种基于空域网格的无冲突航路规划方法,其特征在于,所述步骤四中,数据平滑采用线性插值的方法。