有效
一种近端策略增强的蚁群优化路径覆盖方法
沈贺、王轩、杨益新
西北工业大学
摘要
本发明公开了一种近端策略增强的蚁群优化路径覆盖方法,属于智能路径规划技术领域,在多种复杂障碍与可变规模的栅格环境中,通过引入动态混合决策机制、反馈式信息素更新策略、路径冗余抑制方法以及信息素浓度双阈值约束等核心机制,显著提高路径的整体覆盖率与收敛速度,有效抑制重复访问行为,增强算法的鲁棒性和自适应性,从而为自主移动机器人、无人巡检系统、智能清洁设备等应用提供覆盖全面、路径简洁、响应迅速的高质量规划路径,最终实现高效、可靠的全路径覆盖自主作业。
1.一种近端策略增强的蚁群优化路径覆盖方法,其特征在于,包括以下步骤:S100、将工作环境建模为栅格化空间,并初始化路径规划过程中的已访问集合以及禁忌表,构造采用近端策略优化PPO进行路径规划时工作环境中个体的观测向量;S200、在栅格化空间中,基于混合蚁群优化ACO和近端策略优化PPO结合的方式进行迭代路径规划;在每轮迭代中,计算当前候选路径生成过程中的未访问邻域数以构成启发式乘子,计算当前生成候选路径的出现频次以构成拥挤修正项,将启发式乘子和拥挤修正项作为组合启发式;S300、根据组合启发式,计算采用混合蚁群优化ACO进行全局路径规划时,在每轮迭代中生成候选路径时各候选动作的概率;根据个体的观测向量,计算采用近端策略优化PPO进行局部路径规划时,在每轮迭代中生成候选路径时各候选动作的概率;随迭代进度自适应融合候选动作的概率,生成动作决策概率,进而以动作采样或贪婪的方式在迭代过程中进行路径扩展,生成全体路径,并同步更新禁忌表和已访问集合;S400、基于全体路径的路径覆盖率和路径冗余率,进行路径冗余抑制;S500、基于路径冗余抑制结果,通过精英路径加权和全局最优路径强化机制释放路径规划过程中的信息素,并引入基于覆盖进展的反馈调节机制自适应更新信息素的挥发率,直到生成路径的覆盖率满足设定任务阈值,得到全覆盖的全局最优路径。
2.根据权利要求1所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,所述步骤S100中,采用近端策略优化PPO进行路径规划过程中,当第 步个体处于位置 时,个体的观测向量 为: ; ; ; ; ;式中, 表示当前位置归一化向量, 表示已访问二值图平铺向量, 表示进度比例向量, 表示步数, 表示已访问掩码, 表示矩阵向量化算子, 表示控制覆盖率与步数权重的进度融合系数, 表示 步的覆盖率, 表示相对步数进度, 表示观测向量的总维度, , 表示栅格化空间的长度和宽度, 表示第 步时个体在栅格化空间中的位置坐标, 表示栅格化空间对应的离散状态集合。
3.根据权利要求1所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,所述步骤S200中,启发式乘子 表示为: ; ;式中, 表示候选动作的启发式值, 表示启发式权重因子, 表示路径规划过程中个体的候选栅格点 在其8邻域中的未访问可行邻域数, 表示栅格点 是否在可行单元集合 中的指示函数, 表示栅格点 是否已访问的指示函数, 表示候选栅格点 的某一个邻域栅格点, 表示候选栅格点 的8邻域栅格点集合;所述拥挤修正项 表示为: ; ;式中, 表示第 步迭代中包含栅格点𝑗的路径条数, 表示拥挤抑制权重, 表示第 步迭代时全部个体生成的路径集合, 表示对路径栅格点集合去重后的栅格点集合, 表示取最大值函数, 表示生成路径索引。
4.根据权利要求1所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,所述步骤S300中,采用混合蚁群优化ACO进行全局路径规划时,生成候选路径时各候选动作的概率表示为: ; ;式中, 表示采用混合蚁群优化ACO时,在 步个体从栅格点 到候选下一栅格点 的概率, 表示混合蚁群优化ACO的打分函数, 表示在 步时,栅格点 到候选下一栅格点 所在边上的信息素强度, 表示候选动作的组合启发式,上标 和 分别表示信息素启发式因子和期望启发式因子, 表示与候选下一栅格点 不同的另一候选下一栅格点, 表示第 步时栅格点 的合法候选栅格点集合;采用近端策略优化PPO进行局部路径规划时,生成候选路径时各候选动作的概率表示为: ;式中, 表示采用近端策略优化PPO时,在 步个体从栅格点 到候选下一栅格点 的概率, 表示采用近端策略优化PPO时,策略网络原始输出的动作概率, 表示候选下一栅格点 的候选掩码, 表示采用近端策略优化PPO时,在第 步策略网络为从栅格点 到候选下一栅格点 这一动作原始输出的动作概率, 表示候选下一栅格点 的候选掩码;随迭代进度自适应融合候选动作的概率,生成动作决策概率 表示为: ;式中, 表示随迭代进度变化的融合因子。
5.根据权利要求1所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,所述步骤S400中,全体路径的路径覆盖率 为: ;式中, 表示全体路径 的覆盖率, 表示 的权重, 表示全体路径 的长度, 表示 的权重;全体路径的路径冗余率 为: ;式中, 表示全体路径 的路径冗余率, 表示全体路径的总访问步数, 表示全体路径 去重后的被访问栅格集合。
6.根据权利要求1所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,所述步骤S500中,通过精英路径加权进行信息素释放的方法为:根据路径冗余抑制结果,对当前路径进行排序,选取前若干条路径作为精英路径;按照精英路径排序结果进行信息素的加权释放,且释放强度随精英路径排序大小递减,并以精英路径长度进行归一化。
7.根据权利要求1所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,所述步骤S500中,对历史全局最优路径进行额外信息素释放,其表示为: ;式中, 表示历史全局最优路径 沿其各边追加的信息素增量, 表示全局强化权重, 表示信息素释放常数, 表示历史全局最优路径的长度。
8.根据权利要求1所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,所述步骤S500中,基于覆盖进展的反馈调节机制包括:基于路径覆盖率量化覆盖进展、基于覆盖进展的反馈机制调整信息素挥发系数、基于覆盖率增量量化进展停滞,以及基于覆盖进展和进展停滞调整信息素释放系数。
9.根据权利要求8所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,基于路径覆盖率量化覆盖进展的公式为: ; ;式中, 表示进展提升值, 和 分别表示第 步和第 步的覆盖率, 表示候选栅格坐标 的已访问掩码, 表示路径规划过程中个体在栅格化空间中的候选栅格坐标, 表示可行单元集合;基于覆盖进展的反馈机制调整信息素挥发系数的公式为: ;式中, 表示信息素挥发系数, 表示基础挥发率, 表示控制进展对挥发速率影响的调节系数;基于覆盖率增量量化进展停滞的公式为: ;式中, 表示进展停滞指标, 表示覆盖率增长小于设定的阈值 的连续迭代步数;基于覆盖进展和进展停滞调整信息素释放系数为:当 时,信息素挥发系数 为: ;当 时,信息素挥发系数 为: ;式中, 和 分别表示 和 的权重。
10.根据权利要求8所述的近端策略增强的蚁群优化路径覆盖方法,其特征在于,在更新信息素的过程中,还包括:对路径规划过程中每轮迭代更新得到的信息素矩阵施加上下限双阈值,其表示为: ; ;式中, 表示信息素下限阈值, 表示信息上限阈值, 表示初始化信息素, 表示信息素释放的初始化水平, 表示信息素的单位长度释放量级, 表示信息素释放常数,且 表示信息素的全局比值上限。



