1.一种无人艇集群对抗的策略生成方法,其特征在于,包括以下步骤:收集已知的无人艇集群对抗场景及对应策略作为训练集,建立面向场景的马尔科夫决策过程MDP;每个无人艇i采用增量式方式学习与其协作的无人艇的知识,即:初步选取部分协作无人艇作为第一集合,学习第一集合中无人艇的价值和状态,最大化每个无人艇i的奖励,再选取更多的协作无人艇作为第二集合,学习第二集合中无人艇的价值和状态,二次最大化每个无人艇i的奖励;所述第二集合包含第一集合,对于第二集合与第一集合不同的无人艇,如果从第一集合中无人艇最大化得到的奖励值大于第一阈值,则从第一集合之外的无人艇中,选取与第一集合中无人艇的价值相似度大于第二阈值的无人艇加入第二集合中,否则,随机选取一个无人艇加入第二集合中;综合两次学习优化后的奖励,修正每个无人艇的策略;使用参数化的神经网络表示无人艇的策略,然后利用Actor-Critic的学习方式最大化 函数,从而学习到最优策略;输出最优策略,各无人艇按照最优策略采取行动。
2.根据权利要求1所述的无人艇集群对抗的策略生成方法,其特征在于,第一集合中,对于无人艇i,选取无人艇j的选取概率计算如下: ;其中, 分别是无人艇i和无人艇j的奖励, 是所有无人艇的奖励的均值, 是所有无人艇的奖励的方差。
3.根据权利要求2所述的无人艇集群对抗的策略生成方法,其特征在于,所述相似度的计算采用余弦相似度公式计算。
4.根据权利要求3所述的无人艇集群对抗的策略生成方法,其特征在于,无人艇i与无人艇j协作的奖励函数为: ;其中, 为价值改进奖励, 为局势改进奖励, 和 为调节因子;所述价值改进奖励计算如下: ; 是无人艇j与无人艇i协作时无人艇i的状态动作值,t为当前时刻,t-1为上一时刻, 是上一时刻无人艇j没有与无人艇i协作时无人艇i的状态动作值;所述局势改进奖励为对协作的无人艇的数量发生变化给与的奖励,所述局势改进奖励计算如下: ; 为变化前的局势中的知识, 为变化后的局势中的知识, 为知识参数, 为局势中所有无人艇的状态-价值对。
5.根据权利要求4所述的无人艇集群对抗的策略生成方法,其特征在于,单个无人艇i的总奖励值为: ;L为与无人艇i协作的无人艇总数, 是第l个无人艇的奖励值, 是第l个无人艇的奖励值的权重。
6.根据权利要求5所述的无人艇集群对抗的策略生成方法,其特征在于, 是MDP元组的状态空间,行动空间,选择概率,奖励;马尔科夫决策过程的Q函数如下式所示: ;其中, 是Q函数值, 是t+1时刻的动作, 是t+1时刻的价值, 是t时刻无人艇i的总奖励值, 为折扣因子, 为策略。