有效

一种同策略多目标强化学习框架的设计方法、装置及设备

冯大为、巩旭东、翟远钊、张迅晖、许可乐、丁博、王怀民
中国人民解放军国防科技大学

摘要

本发明涉及一种同策略多目标强化学习框架的设计方法、装置及设备。所述方法包括:构建同策略多目标优化模型。同策略多目标优化模型包括:预训练模型与在线强化模型。预训练模型基于专家示范数据对当前行动策略进行优化训练,得到待强化策略。在策略优化模型上,通过评估待强化策略的目标完成能力,根据目标完成能力获取目标采样概率分布,根据目标采样概率分布采样行为目标,根据采样得到的行为目标收集训练数据,在收集到的训练数据上采用KL正则化的强化学习算法对待强化策略进行在线优化,输出最优目标策略。采用本方法能够提高固定翼飞机的速度矢量控制的策略的推理效率和精度。