1.一种灾区机器人作业路径与能耗优化方法,其特征在于,包括如下步骤:步骤S1:构建机器人的单位路径能耗预测模型;步骤S2:基于单位路径能耗预测模型构建分层强化学习路径调度框架,实现机器人能耗最优加时间最优的路径调度;分层强化学习路径调度框架由上层策略网络和下层执行网络构成;步骤S3:设计事件触发的任务插件机制优化分层强化学习路径调度框架;步骤S4:采用知识蒸馏压缩上层策略网络,将压缩上层策略网络后的分层强化学习路径调度框架部署至机器人边缘计算平台,实现弱网或断网条件下的自主路径决策与执行;单位路径能耗预测模型表示为: ;式中, 表示复杂灾后环境中机器人沿任意路径段的总能耗; 表示机器人的质量; 表示重力加速度; 表示高程差; 表示坡度角; 表示路径段水平投影距离; 表示地表摩擦系数; 表示风阻系数; 表示空气密度; 表示机器人迎风面积; 表示机器人与风的相对速度; 表示 时刻的电池效率;上层策略网络以单位路径能耗预测模型为基础,构建全局拓扑栅格地图 , 表示全局拓扑栅格地图顶点即节点集合, 为边的集合;每条边 关联能耗属性和时间属性;能耗属性采用 ,时间属性表示为: , 表示当前地形下的对标速度; 表示全局拓扑栅格地图中的第 条边,即连接两个顶点的路径段;基于全局拓扑栅格地图,以“路径能耗最小+任务时间最短”为复合奖励函数,采用强化学习策略网络进行路径决策训练,最终输出最优全局路径选择策略,生成能耗最优加时间最优的全局路径;基于下层执行网络对能耗最优加时间最优的全局路径进行局部避障与轨迹平滑:能耗最优加时间最优的全局路径生成后,每进入一个机器人的控制周期,首先通过传感器实时采集机器人局部状态,构建机器人状态向量 , 表示机器人当前的二维坐标, 表示机器人当前的航向角, 、 分别表示机器人当前的线速度和角速度; 表示机器人当前的实时电量; 表示转置;从最优全局路径中,截取未来 步的全局路径参考点 ;构建机器人运动学/动力学模型,描述机器人第k步的状态向量 加上机器人第k步的控制指令 后,到机器人第k+1步的状态向量 的映射关系; , 表示第k步的期望线速度, 表示第k步的期望角速度;构建MPC目标函数,量化优化目标;通过实时感知获取障碍物信息,转化为MPC目标函数的避障约束;求解MPC目标函数,得到控制指令;执行当前控制指令,进入下一个控制周期。
2.根据权利要求1所述的一种灾区机器人作业路径与能耗优化方法,其特征在于:MPC目标函数表示为: ;式中, 表示机器人的控制指令; 、 、 均表示权值矩阵。
3.根据权利要求2所述的一种灾区机器人作业路径与能耗优化方法,其特征在于:奖励函数为: ;式中, 表示强化学习的回报值,用户与引导路径优化; 表示总路径段数; 、 均表示任务权重系数; 表示第 段路径的时间消耗。
4.根据权利要求3所述的一种灾区机器人作业路径与能耗优化方法,其特征在于:步骤S3的具体过程为当新增、删除或调整任务时,首先检测能耗最优加时间最优的全局路径受影响的区域;仅对受影响的区域调用上层策略网络进行重规划,其余路径保持不变。
5.一种灾区机器人作业路径与能耗优化系统,用于执行权利要求1-4任意一项所述的一种灾区机器人作业路径与能耗优化方法,其特征在于,包括:能耗模型构建模块,用于构建机器人的单位路径能耗预测模型;调度模块,用于基于单位路径能耗预测模型构建分层强化学习路径调度框架,实现机器人能耗最优加时间最优的路径调度;分层强化学习路径调度框架由上层策略网络和下层执行网络构成;优化模块,用于设计事件触发的任务插件机制优化分层强化学习路径调度框架;部署模块,用于采用知识蒸馏压缩上层策略网络,将压缩上层策略网络后的分层强化学习路径调度框架部署至机器人边缘计算平台,实现弱网或断网条件下的自主路径决策与执行。
6.一种电子设备,其特征在于,包括处理器、存储器和总线,所述处理器和所述存储器通过所述总线相连,其中,所述存储器用于存储一组程序代码,所述处理器用于调用所述存储器中存储的程序代码,执行如权利要求1-4任意一项所述的一种灾区机器人作业路径与能耗优化方法。
7.一种非易失性计算机存储介质,计算机存储介质存储有计算机可执行指令,其特征在于,该计算机可执行指令执行权利要求1-4任意一项所述的一种灾区机器人作业路径与能耗优化方法。