有效
基于深度强化学习的多阶段装备发展规划方法及系统
刘鹏、李际超、夏博远、杨克巍、姜江、葛冰峰、杨志伟
中国人民解放军国防科技大学
摘要
本发明公开了一种基于深度强化学习的多阶段装备发展规划方法及系统,该方法包括:构建多阶段装备发展规划模型,该多阶段装备发展规划模型用于评估装备发展方案在面向每阶段投资预算和最终能力需求两种不确定条件的能力评价值;根据多阶段装备发展规划模型中的不确定条件构建对应的强化学习框架;基于DQN思想和强化学习框架,构建多阶段装备发展规划优化算法;基于多阶段装备发展规划优化算法,生成最优的多阶段装备发展方案。本发明针对由深度不确定条件下的任意一种随机环境,无需对算法做出任何调整即可快速响应,得到近似最优的多阶段装备发展方案。
1.一种基于深度强化学习的多阶段装备发展规划方法,其特征在于,包括:构建多阶段装备发展规划模型,所述多阶段装备发展规划模型用于评估装备发展方案在面向不确定条件的能力评价值;其中,所述不确定条件包括每阶段投资预算和最终能力需求;根据所述多阶段装备发展规划模型中的所述不确定条件构建对应的强化学习框架;基于DQN思想和强化学习框架,构建多阶段装备发展规划优化算法;基于所述多阶段装备发展规划优化算法,生成最优的多阶段装备发展方案;其中,所述构建多阶段装备发展规划模型,包括:根据每阶段投资预算判断装备发展方案是否为有效方案;在所述装备发展方案为有效方案时,确定所述装备发展方案中所有待发展装备的已发展年份;根据所述待发展装备的投资状态、所述已发展年份和预计发展年限确定待发展装备的发展状态;根据待发展装备的发展状态和预期能力,获取多阶段结束后投资装备组合的实际能力;根据最终能力需求和所述实际能力获取所述投资装备组合的体系贡献率,并将其标记为装备发展的能力评价值;以所述装备发展方案、所述每阶段投资预算和所述最终能力需求为输入参数,并以所述能力评价值为输出参数构建多阶段装备发展规划模型;其中,所述多阶段装备发展规划模型表示为:max Q=f(X,B,Rβ),where:X=[x ij ] m×t ,x ij ∈{0,1};B=[b i ] 1×t ;Rβ=[rβ i ] 1×n ,rβ i ∈[1,9];其中,X=[x ij ] m×t 为所述装备发展方案,m为待发展装备总量,t为阶段数量,x ij 为第j个阶段是否投资第i个待发展装备w i ,若x ij =1,则投资,若x ij =0,则不投资;B=[b i ] 1×t 为所述每阶段投资预算,b i 为第i个阶段的投资预算;Rβ=[rβ i ] 1×n 为最终能力需求,n为关心能力数量,rβ i 为第i项能力a i 的最终能力需求, 为每阶段的投资装备组合成本;e i 为第i个待发展装备w i 的成本;lα i 为第i个待发展装备w i 的预计发展年限。
2.根据权利要求1所述的基于深度强化学习的多阶段装备发展规划方法,其特征在于,所述待发展装备的发展状态包括未发展状态、发展中状态和发展成功状态;所述根据所述待发展装备的投资状态、所述已发展年份和预计发展年限确定待发展装备的发展状态,包括:判断所述待发展装备的是否已投资;若未投资,则确定所述待发展装备处于未发展状态;若已投资,则判断所述待发展装备的已发展年份是否大于等于预计发展年份;若所述待发展装备的已发展年份小于预计发展年份,则所述待发展装备处于发展中状态;若所述待发展装备的已发展年份大于等于预计发展年份,则所述待发展装备处于发展成功状态。
3.根据权利要求1所述的基于深度强化学习的多阶段装备发展规划方法,其特征在于,所述根据最终能力需求和所述实际能力获取所述投资装备组合的体系贡献率,并将其标记为装备发展的能力评价值,包括:获取初始装备组合体系,并根据所述装备发展方案确定投资装备组合;获取未加入所述投资装备组合之前所述初始装备组合体系的总体能力,并获取加入所述投资装备组合之后初始装备组合体系的总体能力;根据加入所述投资装备组合前后所述初始装备组合体系的总体能力获取所述投资装备组合的体系贡献率,并将所述投资装备组合的体系贡献率记录为装备发展的能力评价值;其中,所述投资装备组合的体系贡献率的计算公式为:其中, 为所述投资装备组合V x 的体系贡献率,也即能力评价值Q; 为所述初始装备组合体系加入所述投资装备组合V x 后的总体能力,若任一项能力a i 的实际能力rα i 未达到a i 项能力的最终能力需求rβ i ,则 为0,若全部能力的实际能力rα i 均达到对应的最终能力需求rβ i ,则超过最终能力需求rβ i 越多, 越大;C S 为所述初始装备组合体系未加入所述投资装备组合V x 前的总体能力。
4.根据权利要求1所述的基于深度强化学习的多阶段装备发展规划方法,其特征在于,所述根据所述多阶段装备发展规划模型中的所述不确定条件构建对应的强化学习框架,包括:基于所述多阶段装备发展规划模型构建多阶段发展规划环境,所述多阶段发展规划环境包含自定义环境、观测状态、动作和奖励;构建记忆知识库,所述记忆知识库中包含当前阶段的观测状态、动作、下个阶段的观测状态以及即时奖励;构建智能体,所述智能体包含神经网络、神经网络参数和损失函数。
5.根据权利要求4所述的基于深度强化学习的多阶段装备发展规划方法,其特征在于,所述基于所述多阶段装备发展规划模型构建多阶段发展规划环境,包括:根据多阶段装备发展规划中的待发展装备总量、待发展装备成本、预计发展年限、关系能力数量、预期能力和最终能力需求构建自定义环境;根据多阶段装备发展规划中的当前阶段、当前阶段的投资预算、待发展装备的已发展年份、发展状态构建每个阶段的观测状态;根据每个阶段是否投资待发展装备的结果构建动作;构建每个动作的即时奖励,并构建阶段结束后的回合奖励;其中,所述每个动作的即时奖励为:其中,reward[stage]为所述每个动作的即时奖励;reward[0]为初始奖励;δ[k,stage]为第k个装备的奖励分值,且奖励分值δ[k,stage]由当前阶段stage第k个装备的发展状态确定;invest[stage]为投资装备组合成本;b[stage]为投资预算;所述阶段结束后的回合奖励为:R stage =γ t-stage Q,其中,R stage 为当前阶段stage的分配奖励;γ t-stage 为当前阶段stage的折扣因子;Q为所述能力评价值。
6.根据权利要求5所述的基于深度强化学习的多阶段装备发展规划方法,其特征在于,所述神经网络包含预测神经网络和目标神经网络,所述神经网络参数包含网络层数和节点数;所述构建智能体,包括:确定状态输入信息以及动作输出信息;所述状态输入信息包含当前阶段、当前阶段的装备发展状态、装备已发展年份、当前阶段的投资预算以及最终能力需求;所述动作输出信息为每个动作的价值;根据所述神经网络参数、所述状态输入信息以及所述动作输出信息构建具有输入层、隐藏层和输出层的预测神经网络和目标神经网络;构建损失函数,所述损失函数为:其中,N为动作的数量;y ti 为所述目标神经网络输出的第i个动作a i 的实际价值;y pi 为所述预测神经网络输出的第i个动作a i 的预测价值。
7.根据权利要求6所述的基于深度强化学习的多阶段装备发展规划方法,其特征在于,所述多阶段装备发展规划优化算法包括多阶段发展规划环境与智能体的交互过程和智能体中神经网络的训练过程;所述多阶段发展规划环境与智能体的交互过程包括:获取初始观测状态,将初始观测状态输入所述预测神经网络,并获得所述预测神经网络输出的当前阶段每个动作的预测价值;根据ε-贪心策略选择目标动作;将所述目标动作作用于所述自定义环境获得新观测状态,并计算所述目标动作的即时奖励;将所述初始观测状态、所述目标动作、所述新观测状态以及所述即时奖励存储至所述记忆知识库中;检测所述当前阶段是否为最后阶段,若是,则计算回合奖励,并根据预设的奖励分配机制对回合奖励进行再分配,得到每个阶段的分配奖励;否则使用所述新观测状态对所述初始观测状态进行状态更新,并返回步骤:将初始观测状态输入所述预测神经网络,并获得所述预测神经网络输出的当前阶段每个动作的预测价值;所述智能体中神经网络的训练过程包括:从所述记忆知识库中获取预设数量的记录样本作为训练样本构建训练集;将所述训练集中的每一个所述训练样本输入所述预测神经网络和所述目标神经网络,获取所述预测神经网络输出的每个动作的预测价值,并获取所述目标神经网络输出的每个动作的真实价值;其中,所述每个动作的预测价值均对应一个真实价值;根据所述每个动作的预测价值和真实价值获取每个动作的误差值,根据每个动作的误差值对预测神经网络进行迭代训练,每预设步使用所述预测神经网络对所述目标神经网络进行替换,直至达到迭代结束条件,输出最终的所述目标神经网络,同时提示迭代训练完成。
8.一种基于深度强化学习的多阶段装备发展规划系统,其特征在于,包括:模型构建模块,用于构建多阶段装备发展规划模型,所述多阶段装备发展规划模型用于评估装备发展方案在面向不确定条件的能力评价值;学习框架构建模块,用于根据所述多阶段装备发展规划模型中的所述不确定条件构建对应的强化学习框架;算法构建模块,用于基于DQN思想和强化学习框架,构建多阶段装备发展规划优化算法;方案生成模块,用于基于所述多阶段装备发展规划优化算法,生成最优的多阶段装备发展方案;其中,所述模型构建模块包括:方案有效检测单元,用于根据每阶段投资预算判断装备发展方案是否为有效方案;年份确定单元,用于在所述装备发展方案为有效方案时,确定所述装备发展方案中所有待发展装备的已发展年份;发展状态确定单元,用于根据所述待发展装备的投资状态、所述已发展年份和预计发展年限获取待发展装备的发展状态;能力确定单元,用于根据待发展装备的发展状态和预期能力,获取多阶段结束后投资装备组合的实际能力;价值评价单元,用于根据最终能力需求和所述实际能力获取所述投资装备组合的体系贡献率,并将其标记为装备发展的能力评价值;模型构建单元,用于以所述装备发展方案、所述每阶段投资预算和所述最终能力需求为输入参数,并以所述能力评价值为输出参数构建多阶段装备发展规划模型;其中,所述多阶段装备发展规划模型表示为:max Q=f(X,B,Rβ),where:X=[x ij ] m×t ,x ij ∈{0,1};B=[b i ] 1×t ;Rβ=[rβ i ] 1×n ,rβ i ∈[1,9];其中,X=[x ij ] m×t 为所述装备发展方案,m为待发展装备总量,t为阶段数量,x ij 为第j个阶段是否投资第i个待发展装备w i ,若x ij =1,则投资,若x ij =0,则不投资;B=[b i ] 1×t 为所述每阶段投资预算,b i 为第i个阶段的投资预算;Rβ=[rβ i ] 1×n 为最终能力需求,n为关心能力数量,rβ i 为第i项能力a i 的最终能力需求, 为每阶段的投资装备组合成本;e i 为第i个待发展装备w i 的成本;lα i 为第i个待发展装备w i 的预计发展年限。



