1.一种面向多任务的舰艇集群规划控制方法,其特征在于,包括以下步骤:基于强化学习优化算法对海域的仿真数据进行训练,训练过程中使用多个进程进行多任务并行训练;每个舰艇计算其动作价值函数与状态价值函数之间的差异,得到优势值,并将优势值与方向熵结合,鼓励舰艇在尽可能在熵减的方向选择优势值;计算指挥中心估计的优势值与每个舰艇计算的基于方向熵的优势值之间的误差,并基于误差计算Q函数;采用强化学习中的“演员-评论家”方式进行决策,通过梯度下降方法优化Q函数,训练得到强化学习中的最优参数;将海域实际状态输入训练后的强化学习模型中,输出各舰艇的行动策略。
2.根据权利要求1所述的面向多任务的舰艇集群规划控制方法,其特征在于,优势值计算如下:A π (s,a)=Q π (s,a)―V π (s)π是策略,Q π (s,a)是在状态s下采取动作a的预期回报,V π (s)是在状态s下遵循当前策略的预期回报;将优势值划分为n个方向等级,每个方向等级在所有方向等级中占有一定概率p i ,计算基于方向熵的优势值如下:表示在基于当前知识的情况下,舰艇x对行为的优势值估计。
3.根据权利要求2所述的面向多任务的舰艇集群规划控制方法,其特征在于,计算舰艇计算的基于方向熵的优势值与指挥中心估计的优势值之间的误差,如下所示:其中 与 分别表示舰艇计算的基于方向熵的优势值和指挥中心估计的优势值,i是场景编号,M是场景集合,τ是超参数。
4.根据权利要求3所述的面向多任务的舰艇集群规划控制方法,其特征在于,Q函数如下式所示:其中, 是Q函数值, 是t+1时刻的动作, 是t+1时刻的价值, 是t时刻场景i的总奖励值,π (i) 为场景i下的策略。
5.根据权利要求4所述的面向多任务的舰艇集群规划控制方法,其特征在于,舰艇x与舰艇y之间的奖励函数为:R i =λ 1 r co +λ 2 r en其中,r co 为价值改进奖励,r en 为局势改进奖励,λ 1 和λ 2 为调节因子;所述价值改进奖励计算如下: 是舰艇y与舰艇x协作时舰艇x的状态动作值,t为当前时刻,t-1为上一时刻, 是上一时刻舰艇y没有与舰艇x协作时舰艇x的状态动作值;所述局势改进奖励为对协作的舰艇的数量发生变化给与的奖励,所述局势改进奖励计算如下: 为变化前的局势中的知识, 为变化后的局势中的知识,θ为知识参数, 为局势中所有舰艇的状态-价值对。
6.根据权利要求5所述的面向多任务的舰艇集群规划控制方法,其特征在于,t时刻场景i的总奖励值计算如下:L为场景i中的舰艇总数,r l 是第l个舰艇的奖励值,a l 是第l个舰艇的奖励值的权重。