有效

基于深度强化学习的作战体系设计方法及相关设备

陈涛、林萌龙、张萌萌、陈洪辉、张晓雪、徐成涛、刘俊先、罗爱民、舒振
中国人民解放军国防科技大学

摘要

本申请提供一种基于深度强化学习的作战体系的设计方法及相关设备。该方法包括:利用预置的多个作战系统的和多个作战任务构建组合优化模型和输入序列;将所述输入序列输入预构建的指针网络的编码器中,所述编码器将所述输入序列映射为特征向量;将所述特征向量输入到预构建的所述指针网络的解码器中,所述解码器采用注意力机制确定输出序列,所述输出序列中包括多个所述作战体系;根据所述组合优化模型计算选择各个所述作战体系的奖励回报,根据所述奖励回报,采用梯度下降的方式更新所述指针网络的参数,并利用更新的参数对指针网络进行训练,响应于达到预设的终止条件,完成训练并利用训练完的所述指针网络实施作战体系的设计。