有效

一种基于离线强化学习的机器人搜救方法

丁博、刘惠、翟远钊、冯大为、傅翔、许可乐、万天娇、巩旭东
中国人民解放军国防科技大学

摘要

本发明公开了一种基于离线强化学习的机器人搜救方法,先构建由服务器节点和机器人节点组成的机器人控制系统,服务器节点安装有第一存储模块、第一模型模块、第一轨迹模块、第一策略模块、第二轨迹模块、第二策略模块;机器人节点上部署有探测模块、运动模块、计算模块。第一模型模块使用D4RL数据集训练深度概率神经网络并集成为环境动力学模型。第一轨迹模块、第二轨迹模块分别使用环境动力学模型构建O‑MDP和P‑MDP。在O‑MDP下对第一策略模块进行训练,在P‑MDP下对第二策略模块进行训练,获得机器人搜救策略。机器人节点按照搜救策略执行搜救任务。采用本发明能够在离线数据集数量有限且质量不高的情况下完成搜救任务。