有效
基于改进动态窗口法的移动机器人避障方法
蔡晨晓、张培培、姚娟、邹云、殷明慧、谢云云、卜京
南京理工大学
摘要
本发明涉及移动机器人局部路径规划技术领域,尤其涉及一种基于改进动态窗口法的移动机器人避障方法,包括首先获取移动机器人当前状态、运动参数、目标位置以及障碍物的分布情况,然后搜索移动机器人在速度空间约束下可达到的线速度与角速度,修改动态窗口法的评价函数,接着基于模糊强化学习选择最优路径,最后选择最优路径对应的速度指令,驱动移动机器人避障。本发明基于改进动态窗口法,在提高移动机器人运动轨迹稳定性与平滑性的同时,提高了移动机器人在复杂环境下的避障能力,使移动机器人更具灵活性。
1.基于改进动态窗口法的移动机器人避障方法,其特征在于:包括如下步骤:S1、获取移动机器人当前状态、运动参数、目标位置以及障碍物的分布情况;S2、在速度空间约束下对移动机器人进行速度采样,确定移动机器人可达的速度空间,在速度空间中根据移动机器人的运动方程向前模拟T时刻移动机器人的运动轨迹,生成移动机器人的轨迹空间;S3、修改动态窗口法的评价函数,使移动机器人避开障碍物密集区域,避免发生急停现象,路径选择更合理,同时缩短了移动机器人到目标点的运行时间;S4、构建模糊强化系统,将移动机器人与目标位置的距离以及移动机器人与最近障碍物的距离输入到模糊强化系统中,根据模糊强化系统确定S3中评价函数的权重系数,从而选择最优路径;S5、根据动态窗口法的评价函数确定的最优轨迹所对应的线速度与角速度,作为移动机器人下一时刻的速度指令,控制移动机器人的移动轨迹,实现避障功能。
2.根据权利要求1所述的基于改进动态窗口法的移动机器人避障方法,其特征在于:在步骤S1中,获取移动机器人当前状态、运动参数、目标位置以及障碍物的分布情况,包括如下:所述移动机器人当前状态包括移动机器人的当前位置、方向角、线速度与角速度;运动参数包括移动机器人的最大线速度、最大角速度、加速度和角加速度。
3.根据权利要求2所述的基于改进动态窗口法的移动机器人避障方法,其特征在于:在步骤S2中,包括如下:基于移动机器人本身性能以及环境的约束,所述速度空间约束包括移动机器人最大最小速度约束、电机动力学性能约束以及移动机器人安全允许距离约束;在速度空间约束下,限制了移动机器人移动的线速度与角速度范围,构成移动机器人可达的速度空间;根据t时刻移动机器人的位置和方向角,利用移动机器人的运动方程可以得到t+1时刻移动机器人的位置和方向角,向前模拟T时刻,在所述移动机器人可达速度空间中,不同的线速度与角速度取值可以得到多条运动轨迹,生成移动机器人的轨迹空间。
4.根据权利要求3所述的基于改进动态窗口法的移动机器人避障方法,其特征在于:步骤S3中,在动态窗口法的评价函数中,引入目标位置与移动机器人和最近障碍物之间的相对夹角评价因子,使移动机器人避障路径更合理,同时加入目标相对距离评价因子,在确保路径合理的基础上缩短了移动机器人到目标点的时间,修改后的评价函数为:其中,heading(v(t),ω(t))为目标方位角评价因子,表示为:heading(v(t),ω(t))=180°-θ (2)式(2)中:θ表示目标点相对于预测轨迹末端移动机器人的夹角,目标方位角评价因子用来评估预测轨迹末端移动机器人的行驶方向和目标位置的角度差,使得移动机器人朝着目标位置前进,α为heading(v(t),ω(t))的权重系数;dist(v(t),ω(t))为移动机器人在(v(t),ω(t))时所对应轨迹上与障碍物的最近距离评价因子,用来评估预测轨迹末端移动机器人与障碍物的最小距离,使得移动机器人尽量远离障碍物,β为dist(v(t),ω(t))的权重系数;velocity(v(t),ω(t))为速度评价因子,表示为:velocity(v(t),ω(t))=│v(t)│ (3)速度评价因子用来评估移动机器人的速度大小,使得机器人快速移动,γ为velocity(v(t),ω(t))的权重系数;relativeAngle(v(t),ω(t))为目标位置分别与移动机器人和最近障碍物之间的相对夹角评价因子,表示为:relativeAngle(v(t),ω(t))=│obstacleζ-goalθ│ (4)式(4)中,obstacleζ表示预测轨迹末端移动机器人与障碍物的最小夹角,goalθ表示目标点相对于预测轨迹末端移动机器人的夹角,相对夹角评价因子用来评估目标位置与移动机器人和最近障碍物之间相对夹角的大小,使得移动机器人避开障碍物密集的区域,η为relativeAngle(v(t),ω(t))的权重系数;Goaldist(v(t),ω(t))为预测轨迹末端移动机器人与目标位置的相对距离函数,表示为:式(5)中,d G 为预测轨迹末端移动机器人与目标点的最短距离,d Gmax 为设定的d G 的最大值,Goaldist(v(t),ω(t))用来评估预测轨迹末端移动机器人与障碍物的距离,使得移动机器人到达目标位置的时间最短,μ为Goaldist(v(t),ω(t))的权重系数。
5.根据权利要求4所述的基于改进动态窗口法的移动机器人避障方法,其特征在于:步骤S4中,构建模糊强化系统,包括如下:所述模糊强化系统将模糊推理系统与Q学习算法相结合,将当前状态向量s输入系统后,通过模糊推理系统选择一个动作A执行,每个动作都有相应的权值Q,用Q学习算法不断更新Q值表直至其收敛,然后根据重心法解模糊,得到系统的输出动作向量a。
6.根据权利要求5所述的基于改进动态窗口法的移动机器人避障方法,其特征在于:在步骤S4中,包括如下:将所述移动机器人与目标位置的距离Gd以及移动机器人与最近障碍物的距离Od输入到模糊强化系统中,即输入状态向量s={Gd,Od};将这两个变量进行模糊化,分割为S,M,L三个模糊集,然后根据强化学习更新Q值表,利用重心法解模糊,得到系统的输出动作向量a={α,β,γ,η,μ},其中α,β,γ,η,μ为动态窗口法评价函数的权重系数;将模糊强化系统的输出动作向量输出到环境中,利用评价函数对移动机器人轨迹空间中各条模拟轨迹进行打分,得分最高的轨迹为最优的避障轨迹;对于模糊强化系统中接近目标的行为,设计的奖励函数如下:其中,R t 为移动机器人t时刻获得的奖励,τ为设置的安全阈值,当Od<τ时,设置奖励值为-500,表示移动机器人与障碍物距离过近,有可能与障碍物发生碰撞;Gd 1 为当前时刻移动机器人与目标位置的距离,Gd 0 为上一时刻移动机器人与目标位置的距离,当Gd 1 >Gd 0 时,设置奖励值为-200,表示移动机器人未朝目标位置移动;当Od>τ且Gd 1 ≤Gd 0 时,设置奖励值为+100,使移动机器人能够保持安全适当的速度向目标移动;当移动机器人到达目标时,设置奖励值为+200,使移动机器人能够在不断学习过程中尽可能快速到达目标位置。
7.根据权利要求6所述的基于改进动态窗口法的移动机器人避障方法,其特征在于:在步骤S5中,包括如下:A、首先给权值Q赋一个[0,1]区间内的随机值,通过强化学习反复学习直至其收敛;B、然后根据强化学习出的Q值表随机调整评价函数的系数,获得移动机器人的最优避障轨迹;C、将最优轨迹对应的线速度和角速度作为移动机器人下一时刻的速度指令,控制移动机器人的运动轨迹,从而实现避障功能。






