1.一种多智能体强化学习方法,其特征在于,包括以下步骤:获取观测,智能体根据观测获取动作概率分布,以及推理队友智能体基于所述观测的动作概率分布;根据获得的动作概率分布,计算每个智能体与队友智能体的行为一致性;基于行为一致性,通过动态缩放网络获取动态调节因子,根据动态调节因子计算行为一致性的内部奖励;根据链式求导法则,以最大化外部回报为目标,对动态缩放网络的参数进行优化;使用优化完成的策略实现多智能体的协作任务;所述通过动态缩放网络获取动态调节因子,根据动态调节因子计算行为一致性的内部奖励,包括:构建动态缩放网络;其中,该动态缩放网络的输入为全局观测,输出为与不同智能体之间行为一致性的动态调节因子;根据动态调节因子和行为一致性,计算获得基于行为一致性的内部奖励;对于智能体 ,在 时刻获取的基于行为一致性的内部奖励如下: ,其中, 为智能体 自身动态缩放网络输出的动态调节因子, 为一个缩放超参数, 表示智能体 与智能体 在 时刻的行为一致性, 为智能体 的队友智能体集合;当 值为负时,鼓励智能体 和智能体 之间做出一致性行为;当 值为正时,则惩罚智能体 和智能体 之间做出一致性行为;所述根据链式求导法则,以最大化外部回报为目标,对动态缩放网络的参数进行优化,包括:构建外部价值目标函数,并将外部价值目标函数的导数通过链式法则,与动态缩放网络的参数相关联,从而使得动态调节因子的更新方向与外部价值增大的方向一致;所述根据链式求导法则,以最大化外部回报为目标,对动态缩放网络的参数进行优化,包括:设第 个智能体对应动态缩放网络的参数为 ,利用链式求导法则,外部回报 对 的梯度 表示为: (1),其中 表示第 个智能体对应的执行器策略更新后的网络参数;公式(1)中的 ,进一步表示为: (2),其中 表示外部优势,由外部评判器给出; 表示第 个智能体更新后的执行器策略输出动作为 的概率; 为记录第 个智能体历史观测的和动作的缓存器;根据Soft Actor-Critic算法, 的计算表示为: (3),其中 为学习率, 为Soft Actor-Critic算法中的熵温度系数, 为第 个智能体对应的更新后辅助评判器在输入其观测 时的动作价值;在Soft Actor-Critic算法中,为每个智能体定义两个相同的辅助评判器分别输出两个动作价值 和 ,每个辅助评判器的参数独立更新,并且所参与的奖励输入为内部奖励与外部奖励之和,即 , 为外部奖励,则 ;进一步推导出,式(1)中的 等于: (4),其中 、 分别为第 个智能体对应辅助评判器更新前和更新后的参数; 为第 个智能体对应的更新前辅助评判器在输入其观测 时的动作价值; 为第 个智能体更新前的执行器策略;将式(2)和式(4)代入式(1),计算出外部回报 对 的梯度 ;通过梯度上升法完成对动态缩放网络参数的优化。
2.根据权利要求1所述的一种多智能体强化学习方法,其特征在于,所述获取观测,智能体根据观测获取动作概率分布,以及推理队友智能体基于所述观测的动作概率分布,包括:对于每个智能体,输入该智能体当前时刻的观测,智能体利用自身的执行器推理出下一步的动作概率分布;智能体将自身的观测输入其他智能体的执行器,推理出队友智能体执行器面对相同观测时的动作概率分布。
3.根据权利要求1所述的一种多智能体强化学习方法,其特征在于,所述计算每个智能体与队友智能体的行为一致性,包括:计算每个智能体推理得到的自身下一步的动作概率分布,和队友智能体面对相同观测时输出的动作概率分布之间的相似度,作为行为一致性。
4.根据权利要求3所述的一种多智能体强化学习方法,其特征在于,所述相似度采用KL散度进行计算,计算公式如下: ,其中, 表示智能体 在 时刻获取与智能体 相同观测时,输出动作为第 类动作的概率, 表示智能体 在 时刻输出动作为第 类动作的概率, 表示智能体动作空间的长度。
5.一种多智能体强化学习装置,其特征在于,包括:至少一个处理器;至少一个存储器,用于存储至少一个程序;当所述至少一个程序被所述至少一个处理器执行,使得所述至少一个处理器实现权利要求1-4任一项所述方法。
6.一种计算机可读存储介质,其中存储有处理器可执行的程序,其特征在于,所述处理器可执行的程序在由处理器执行时用于执行如权利要求1-4任一项所述方法。