1.一种基于深度强化学习的作战体系的设计方法,其特征在于,包括:确定所述作战系统的个数、多个所述作战系统各自提供的能力、作战任务的个数、多个所述作战任务各自的能力需求、和多个所述作战系统各自的成本;利用各个所述作战系统各自提供的能力和各个所述作战系统各自的成本构建组合优化模型;利用各个所述作战任务的能力需求、各个所述作战系统提供的能力和各个所述作战系统的成本建立输入序列;其中,所述输入序列的包括有多个节点,每个所述节点包括1个作战系统提供的能力、1个作战任务的能力需求和该作战系统的成本;其中,所述利用各个所述作战系统各自提供的能力和各个所述作战系统各自的成本构建组合优化模型,包括:利用各个所述作战系统各自提供的能力和各个所述作战系统各自的成本构建体系总成本最小化的目标;将每个所述作战系统约束为最多只用于完成1个作战任务;将完成1个作战任务的多个作战系统各自的能力之和约束为大于等于该作战任务的能力需求;将所述输入序列输入预构建的指针网络的编码器中,所述编码器将所述输入序列映射为特征向量;将所述特征向量输入到预构建的所述指针网络的解码器中,所述解码器采用注意力机制确定输出序列,所述输出序列中包括多个所述作战体系;根据所述组合优化模型计算选择各个所述作战体系的奖励回报,根据所述奖励回报,采用梯度下降的方式更新所述指针网络的参数,并利用更新的参数对指针网络进行训练,响应于达到预设的终止条件,完成训练并利用训练完的所述指针网络实施作战体系的设计。
2.根据权利要求1所述的方法,其特征在于,所述编码器将所述输入序列映射为特征向量,包括:将所述输入序列中的每个所述节点编码1个嵌入向量;将全部所述嵌入向量组成为特征向量。
3.根据权利要求2所述的方法,其特征在于,所述所述解码器采用注意力机制确定输出序列,包括:采用注意力机制计算选择每个所述嵌入向量的注意力值;对全部所述嵌入向量的注意力值进行概率分布的计算,得到选择各个所述节点的概率;选择所述概率最大的节点,作为当前时刻的输出动作;将所述当前时刻的输出动作与之前全部时刻的输出动作结合为当前时刻的所述输出序列。
4.根据权利要求1所述的方法,其特征在于,所述根据所述组合优化模型计算选择各个所述作战体系的奖励回报,包括:对于各个所述作战体系,执行操作:将所述作战体系的所述奖励回报与所述组合优化模型中的所述体系总成本最小化的目标之间建立反比关系。
5.根据权利要求1所述的方法,其特征在于,所述指针网络的编码器的预构建,包括:采用一维卷积神经网络构建所述编码器;所述指针网络的解码器的预构建,包括:采用记忆存储功能的循环神经网络构建所述解码器。
6.一种基于深度强化学习的作战体系的设计装置,包括:组合优化模型构建模块、编码模块、解码模块和训练模块;其中,所述组合优化模型构建模块,被配置为,确定所述作战系统的个数、多个所述作战系统各自提供的能力、作战任务的个数、多个所述作战任务各自的能力需求、和多个所述作战系统各自的成本;利用各个所述作战系统各自提供的能力和各个所述作战系统各自的成本构建组合优化模型;利用各个所述作战任务的能力需求、各个所述作战系统提供的能力和各个所述作战系统的成本建立输入序列;其中,所述输入序列的包括有多个节点,每个所述节点包括1个作战系统提供的能力、1个作战任务的能力需求和该作战系统的成本;其中,所述利用各个所述作战系统各自提供的能力和各个所述作战系统各自的成本构建组合优化模型,包括:利用各个所述作战系统各自提供的能力和各个所述作战系统各自的成本构建体系总成本最小化的目标;将每个所述作战系统约束为最多只用于完成1个作战任务;将完成1个作战任务的多个作战系统各自的能力之和约束为大于等于该作战任务的能力需求;所述编码模块,被配置为,将所述输入序列输入预构建的指针网络的编码器中,所述编码器将所述输入序列映射为特征向量;所述解码模块,被配置为,将所述特征向量输入到预构建的所述指针网络的解码器中,所述解码器采用注意力机制确定输出序列,所述输出序列中包括多个所述作战体系;所述训练模块,被配置为,根据所述组合优化模型计算选择各个所述作战体系的奖励回报,根据所述奖励回报,采用梯度下降的方式更新所述指针网络的参数,并利用更新的参数对指针网络进行训练,响应于达到预设的终止条件,完成训练并利用训练完的所述指针网络实施作战体系的设计。
7.一种电子设备,包括存储器、处理器及存储在所述存储器上并可由所述处理器执行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1至5中任意一项所述的方法。
8.一种非暂态计算机可读存储介质,其特征在于,所述非暂态计算机可读存储介质存储计算机指令,所述计算机指令用于使计算机执行根据权利要求1至5中任一项所述的方法。