1.一种基于强化学习的多阶段装备组合规划方法,其特征在于,包括以下步骤:S1:确定输入参数所述输入参数包括:装备项目数量、场景数量、场景信息、阶段规划区间、总经费以及预算违背阈值,所述场景信息包括装备的效能和成本;S2:构建组合优化模型首先,针对单阶段装备组合优化问题,考虑多个可能场景,构建单阶段多场景组合优化模型;然后,根据武器装备发展规划周期,并基于所述单阶段多场景组合优化模型,构建多阶段多场景组合优化模型;所述单阶段多场景组合优化模型和多阶段多场景组合优化模型在如下假设条件下构建:(1)当前待开发装备项目清单是已知的,同时允许在未来任一阶段增加新的装备,以描述现实中装备的更新交替;(2)不同场景下每个装备的效能未知,服从一定的分布;(3)装备之间没有相互依存关系,即所有装备可并行发展;(4)一旦装备项目被纳入规划,则不能从装备清单中删除直至完成;所述单阶段多场景组合优化模型以最大化装备组合效能和最小化装备组合成本为目标,目标函数为:x i ∈{0,1}式中,k∈[1,K]表示一个场景,K代表场景的总数,B代表给定的经费预算,δ代表预算违背阈值,x i ∈X代表当前装备清单X中第i个装备,c i 代表装备x i 对应的开发成本,r i k 表示场景k下装备项目x i 的效能,i表示装备序号;所述多阶段多场景组合优化模型以整个规划周期内最大化装备组合效能和最小化装备组合成本为目标,目标函数为:x it ∈{0,1}式中, 表示阶段t、场景k下装备项目x i 的效能,c it 为装备x i 在阶段t下的开发成本,x it 为装备x i 在阶段t下的选择位,B t 为阶段t下的经费预算,δ t 代表阶段t下的预算违背阈值;S3:构建优化求解算法基于强化学习中的Q-Learning方法,搭建求解步骤S2中组合优化模型的优化求解算法;S4:确定最终组合规划方案将输入参数输入到组合优化模型中,并采用步骤S3所构建的优化求解算法进行求解,得到最优组合规划方案。
2.根据权利要求1所述的一种基于强化学习的多阶段装备组合规划方法,其特征在于,所述步骤S3的优化求解算法,包括以下步骤:S3.1:在每个阶段,基于之前所有阶段的装备组合方案,生成该阶段的待选装备集合;S3.2:针对K+1个目标的优化问题,采用非支配排序遗传算法NSGA或多目标进化算法MOEA求解当前阶段装备发展的Pareto解集,其中K是场景数量;S3.3:基于上个阶段优化过程获得的Pareto解集,采用探索或者利用模式选择一个装备组合方案,并更新当前阶段下选择该装备组合方案的Q值;S3.4:迭代上述步骤,直到达到停止标准。
3.根据权利要求2所述的一种基于强化学习的多阶段装备组合规划方法,其特征在于,所述步骤S3.3中,具体选择探索或者利用模式,由参数控制的随机概率决定,所述探索模式,允许从Pareto解集中随机选择一个方案;所述利用模式,是求解Pareto解中的每一个装备组合方案对应的Q值,选择Q值最大的作为当前阶段的装备组合方案。
4.根据权利要求3所述的一种基于强化学习的多阶段装备组合规划方法,其特征在于,所述步骤S3.3中,更新当前阶段选择该装备组合方案的Q值,包括以下子步骤:S3.3.1:构建回报函数,计算当前阶段选择不同装备组合方案的回报值;S3.3.2:根据步骤S3.3.1得到回报值,通过标准的Q-Learning公式对Q值进行更新。
5.根据权利要求4所述的一种基于强化学习的多阶段装备组合规划方法,其特征在于,所述步骤S3.3.1中,计算回报值的回报函数为:R t =w 1 R E +w 2 R C ,式中,R t 代表回报值,R E 代表当前所选装备组合方案效能相关回报,R C 代表所选装备组合方案成本相关回报,w 1 和w 2 是针对两个优化目标的权重,t表示阶段序号。
6.根据权利要求5所述的一种基于强化学习的多阶段装备组合规划方法,其特征在于,所述R E 采用如下公式度量:式中,K代表场景的个数,上式等号右边括号中前半部分代表当前所选择装备组合a在K个场景中效能的加和平均, 表示装备组合a在场景k中的效能,后半部分代表下一阶段所有可能装备组合a’在K个场景中效能的加和平均, 表示装备组合a’在场景k中的效能,P t+1 为下一阶段的最优Pareto解集, 代表Pareto解集中解的个数。
7.根据权利要求5所述的一种基于强化学习的多阶段装备组合规划方法,其特征在于,所述R C 采用如下公式度量:式中,C a 表示当前阶段装备组合a的成本,C a' 表示下一阶段装备组合a’的成本,B t 表示阶段t的经费预算,B t+1 表示下一阶段的经费预算,P t+1 表示下一阶段的最优Pareto解集, 表示Pareto解集中解的个数。
8.根据权利要求2所述的一种基于强化学习的多阶段装备组合规划方法,其特征在于,所述非支配排序遗传算法采用NSGA-III算法,所述多目标进化算法采用MOEA/D算法。