有效

基于深度强化学习的多机协同空战规划方法及系统

冯旸赫、程光权、施伟、黄魁华、黄金才、刘忠
中国人民解放军国防科技大学

摘要

本发明提出了基于深度强化学习的多机协同空战规划方法及系统,通过将战机视为智能体,构建强化学习智能体模型,通过集中式训练‑分布式执行架构对网络模型进行训练,克服了多机协同时因不同实体间的动作区分度不大,网络模型探索性不强的缺点。通过在奖励值中嵌入专家经验,解决了现有技术中需要大量专家经验支撑的问题。通过经验共享机制,所有智能体共享一套网络参数和经验回放库,解决了单个智能体的策略不只取决于自身的策略和环境的反馈,同时还受其他智能体行为和合作关系的影响问题。通过增加优势值绝对值较大样本的采样概率,使奖励值极大或极小的样本都能影响神经网络的训练,加快算法收敛速度。通过添加策略熵提高智能体的探索能力。