一种基于合作博弈的飞行器集群多任务调度系统及其工作方法
摘要
本发明公开了一种基于合作博弈的飞行器集群多任务调度系统及其工作方法,所述系统包括仿真环境模块、分层策略网络模块、中心化价值网络模块以及训练与执行模块;所述仿真环境模块用于构建多智能体空战对抗环境,生成训练所需的状态、奖励和交互数据;所述分层策略网络包括共享时空表征编码器f<Sub>θ</Sub>(·)、高层策略网络π<Sub>H</Sub>(a<Sub>H</Sub>|z)和低层策略网络π<Sub>L</Sub>(a<Sub>L</Sub>|z;a<Sub>H</Sub>)三个模块;所述中心化价值网络用于在训练阶段接收全局状态信息,对我方智能体集群整体回报进行估计,计算优势函数<Image he="77" wi="80" file="DDA0005658239440000011.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>通过最小化价值损失实现自身网络的优化;所述训练与执行模块在中心化训练阶段利用全局状态S<Sub>t</Sub>优化中心化价值网络参数<Image he="52" wi="35" file="DDA0005658239440000012.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>和分层策略网络参数θ<Sub>H</Sub>和θ<Sub>L</Sub>,在分布式执行阶段各智能体依据局部观测<Image he="76" wi="52" file="DDA0005658239440000013.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>独立决策,输出空战决策a<Sub>i</Sub>。



