在审
基于奖励中心化的无人排雷装备智能体协作方法
摘要
本发明公开了基于奖励中心化的无人排雷装备智能体协作方法,将无人排雷装备作为一个智能体,构建此作战区域中的多智能体决策框架、多个无人排雷装备值网络中的奖励中心化机制和经验回放池;对基于奖励中心化的多智能体双延迟深度确定性策略梯度架构所构成的多个深度神经网络进行训练,得到基于奖励中心化的多智能体双延迟深度确定性策略梯度模型;对模型进行求解。本发明核心在于改造了全局值网络的时间差分目标,通过引入平均奖励机制,放大了不同状态‑动作组合之间的价值差异。这一设计使得值函数逼近器能够更加精准、高效地聚焦于挖掘真正有效的协作策略路径,有效降低因非稳态环境与多智能体耦合作用导致的个体动作价值估计偏差。
暂无引用专利




