有效
基于深度强化学习的多机协同空战规划方法及系统
冯旸赫、程光权、施伟、黄魁华、黄金才、刘忠
中国人民解放军国防科技大学
摘要
本发明提出了基于深度强化学习的多机协同空战规划方法及系统,通过将战机视为智能体,构建强化学习智能体模型,通过集中式训练‑分布式执行架构对网络模型进行训练,克服了多机协同时因不同实体间的动作区分度不大,网络模型探索性不强的缺点。通过在奖励值中嵌入专家经验,解决了现有技术中需要大量专家经验支撑的问题。通过经验共享机制,所有智能体共享一套网络参数和经验回放库,解决了单个智能体的策略不只取决于自身的策略和环境的反馈,同时还受其他智能体行为和合作关系的影响问题。通过增加优势值绝对值较大样本的采样概率,使奖励值极大或极小的样本都能影响神经网络的训练,加快算法收敛速度。通过添加策略熵提高智能体的探索能力。
1.一种基于深度强化学习的多机协同空战规划方法,其特征在于,包括以下步骤:步骤1:基于Actor-Critic强化学习框架下的近端策略优化PPO算法,构建Actor动作决策神经网络和Critic动作评价神经网络;步骤2:将战机视为一个个智能体,使用仿真推演平台产生战场环境态势信息,所述战场态势信息包括敌我战机的实时飞行参数以及对空导弹的实时飞行参数,对所输入的战场环境态势信息进行预处理;步骤:3:根据预处理后的战场环境态势信息,将待决策的第i个智能体在t时刻的局部环境态势信息s t,i 输入Actor动作决策神经网络,得到每个待决策智能体的动作决策信息a t,i ,并将动作决策信息解码封装为各智能体的操作指令控制各智能体执行新的动作,i=1...n,n为智能体的数量;步骤4:将待决策智能体的局部环境态势信息s t,i 、智能体的动作决策信息a t,i 、待决策智能体执行新动作后的环境态势信息s t+1,i 和环境针对该动作反馈的奖励值r t+1,i 按照四元组(s t,i ,a t,i ,s t+1,i ,r t+1,i )的形式存储进经验回放库,每一个智能体的信息均按照该格式进行存储;步骤5:重复步骤2至4,直至经验回放库中的样本数量达到可训练所规定的数量;步骤6:从经验回放库中选择一批样本,将同一时刻的所有智能体的联合状态信息以及所有智能体的动作信息作为一条样本输入到Critic动作评价神经网络进行网络参数的训练更新,将各智能体的局部环境态势信息作为一条样本输入到Actor动作决策神经网络进行网络参数训练更新;步骤7:随机删除经验回放库中的一部分样本,重复步骤2至5,直至达到训练结束条件,得到训练好的强化学习智能体;步骤8:将当前待决策智能体的局部环境态势信息输入训练好的强化学习智能体的Actor网络,得到各待决策智能体的动作决策信息,将动作决策信息解码封装为各智能体的操作指令控制各智能体执行新的动作;步骤4中所述奖励值指的是使用嵌入专家经验奖励机制,奖励函数为:r=(1-τ)·score total +τ·score encourage其中:score encourage =dis cur -dis nextscore total 为传统奖励项,根据推演事件的得分来决定的,score encourage 为基于专家经验的额外奖励项,dis cur 表示当前时刻智能体距离目标点的距离,dis next 表示下一时刻智能体距离目标点的距离,τ是衰减系数,随着训练的进行,该值按照公式τ=(τ-τ step )/τ temp 逐渐减小,τ step 是递减步长,τ temp 是衰减基数。
2.根据权利要求1所述的规划方法,其特征在于,步骤6中从经验回放库中选择一批样本数据的选择方法是:1)对不同智能体分别计算每个智能体所产生的样本的采样权重,具体为:将参与采样的每个智能体产生的样本分别按照优势值的绝对值,由大至小从1到N进行排序,样本采样权重计算公式:其中,j表示样本排序序号,P j 就是第j号样本的采样权重,N表示一个智能体包含的样本数量,所述优势值的计算公式为: 表示第i个智能体在t时刻产生的样本的优势值,φ表示Critic网络的参数,V φ (s t,i )表示Critic网络对第i个智能体在t时刻的状态s t,i 的评价值,r t,i 表示第i个智能体在t时刻获得的环境奖励,γ表示折扣因子,T表示本局仿真推演结束时刻;2)根据各智能体所产生的样本的采样权重,从经验回放库中对各智能体分别采集预先设定数量的样本。
3.根据权利要求2所述的规划方法,其特征在于,步骤6中对Actor动作决策神经网络进行网络参数更新的方法是:步骤6.1:计算不同智能体产生的样本在对Actor网络训练时所产生的损失函数值,所述损失函数值为添加策略熵的损失函数值,其中,下标i表示第i个智能体,L i 表示第i个智能体的损失函数值,θ i 表示第i个智能体当前更新的新策略, 表示第i个智能体采样时使用的旧策略,L CLIP (θ i )表示使用标准PP0强化学习算法计算出来的第i个智能体的损失函数值, 表示第i个智能体在策略θ i 下的策略熵,ε是一个裁剪参数, 表示在策略θ i 下给定状态s t,i 后采取动作a t,i 的概率,p t (θ i )表示第i个智能体在新旧策略下产生样本(s t,i ,a t,i )的概率分布比,A表示动作空间集,clip(x,x MIN ,x MAX )为裁剪函数,x MIN 为x的最小值,x MAX 为x的最大值;步骤6.2:根据每个智能体产生的样本在对Actor网络训练时所产生的损失函数值L i 后,经过反向传播,求解出Actor网络参数的更新梯度值J Ai ;步骤6.3:将不同智能体所产生的样本计算的更新梯度值J Ai 进行加权,按照全局梯度公式分别计算出Actor网络下的全局梯度值为:n表示智能体总数,w i 表示预先设定的智能体i对全局梯度计算的影响权重;步骤6.4:根据Actor网络下的全局梯度值对Actor网络参数进行更新。
4.根据权利要求3所述的规划方法,其特征在于,步骤6中对Critic动作评价神经网络进行网络参数更新的方法是:步骤6.5:计算样本在对Critic动作评价神经网络模型训练时所产生的损失函数值,所述损失函数值计算的具体方法为:Loss φ =r t+1 +γV φ (s t+1 )-V φ (s t )Loss φ 表示在Critic的网络参数为φ的条件下,t时刻所有智能体的联合状态信息的损失函数值;步骤6.6:计算Critic动作评价神经网络模型训练时所产生的损失函数值Loss φ 后,经过反向传播,求解出Critic动作评价神经网络的更新梯度值J C ;步骤6.7:根据Critic动作评价网络下的更新梯度值J C 对Critic动作评价网络参数进行更新。
5.一种基于深度强化学习的多机协同空战规划系统,其特征在于,包括以下模块:神经网络模型构建模块:采用Actor-Critic强化学习框架下的近端策略优化PPO算法作为内核,包含Actor动作决策神经网络和Critic动作评价神经网络;态势信息处理模块:用于接收仿真推演平台产生的未经过加工处理的战场环境态势信息,所述战场态势信息包括敌我战机的实时飞行参数以及对空导弹的实时飞行参数,并对这些信息数据进行预处理;动作决策模块:用于根据预处理后的战场环境态势信息,将待决策的第i个智能体在t时刻的局部环境态势信息s t,i 输入Actor动作决策神经网络,得到每个待决策智能体的动作决策信息a t,i ,并将动作决策信息解码封装为各智能体的操作指令控制各智能体执行新的动作,i=1...n,n为智能体的数量;经验回放库存储模块:用于管理样本的产生、加工、存储与提取,将待决策智能体的局部环境态势信息s t,i 、智能体的动作决策信息a t,i 、待决策智能体执行新动作后的环境态势信息s t+1,i 和环境针对该动作反馈的奖励值r t+1,i 按照四元组(s t,i ,a t,i ,s t+1,i ,r t+1,i )的形式存储进经验回放库;所述奖励值指的是使用嵌入专家经验奖励机制,奖励函数为:r=(1-τ)·score total +τ·score encourage其中:score encourage =dis cur -dis nextscore total 为传统奖励项,根据推演事件的得分来决定的,score encourage 为基于专家经验的额外奖励项,dis cur 表示当前时刻智能体距离目标点的距离,dis next 表示下一时刻智能体距离目标点的距离,τ是衰减系数,随着训练的进行,该值按照公式τ=(τ-τ step )/τ temp 逐渐减小,τ step 是递减步长,τ temp 是衰减基数;深度强化学习网络训练模块:用于从经验回放库存储模块中采集每个智能体所产生的一批样本,计算各样本的损失函数和网络参数的更新梯度,将同一时刻的各智能体的环境态势信息作为全局环境态势信息输入到Critic动作评价神经网络进行网络参数更新,将各智能体的局部环境态势信息输入到Actor动作决策神经网络进行网络参数更新;动作预测模块:用于获取当前待决策智能体的局部环境态势信息输入训练好的深度强化学习网络训练模块中的Actor动作决策神经网络模型中,得到各待决策智能体的动作决策信息,将动作决策信息解码封装为各智能体的操作指令控制各智能体执行新的动作。



