有效

基于增量强化学习的机器人安全训练方法、装置和设备

李聪、张兴龙、徐昕
中国人民解放军国防科技大学

摘要

本申请涉及一种基于增量强化学习的机器人安全训练方法、装置和设备。所述方法包括:采用历史数据对机器人的非线性系统中未知模型信息进行估计,基于线性增量系统构建增广增量系统,并且构建惩罚函数表征机器人完成任务的需求,根据第k步之后的惩罚函数,得到用于评估机器人性能的值函数;根据值函数,构建Q‑函数,利用预先构建的模型引导增量强化学习算法在线迭代求解Q‑函数,得到最优控制策略和最优误差估计策略,以及机器人模型,并利用在线学习到的机器人模型进行前向预测促进强化学习在线训练,基于在线学习到的机器人模型,构建二次型约束优化对机器人最优控制策略进行微调,以此实现在线安全学习。采用本方法能够实现机器人安全训练。

暂无引用专利