有效

一种无人艇集群对抗的策略生成方法

黄魁华、张勇、吴克宇、程光权、黄金才、杜航、廖世江
中国人民解放军国防科技大学

摘要

本发明公开了一种无人艇集群对抗的策略生成方法,包括以下步骤:建立面向场景的马尔科夫决策过程;每个无人艇i采用增量式方式学习与其协作的无人艇的知识;综合两次学习优化后的奖励,修正每个无人艇的策略;使用参数化的神经网络表示无人艇的策略,然后利用Actor‑Critic的学习方式最大化Q函数,从而学习到最优策略;输出最优策略,各无人艇按照最优策略采取行动。本申请面向无人场景态势不断变化演进,满足多无人艇联合策略的需求;无人艇通过两阶段增量式学习其它无人艇的知识,修正直接由协同决策提供的原始策略,更贴近于实际场景态势。