1.一种分布式多智能体合作方法,其特征在于,包括:通过将过去对局历史中步骤数量的观测状态进行存储以构造观测历史寄存器;所述历史寄存器随着智能体与环境交互的进行,所述历史寄存器持续接受新的历史状态,并将超过容量限制的早期的历史状态丢弃;构造历史背景网络,其中,所述历史背景网络的输入为当前观测状态,与历史寄存器中的历史状态,通过数据挖掘与融合,所述历史背景网络的输出历史背景嵌入状态;所述构造历史背景网络具体包括:利用软注意力机制,根据最近的历史步骤动态学习信念,引入观测嵌入网络 和行动嵌入网络 ;所述观测嵌入网络 和所述行动嵌入网络 接收观测或者以独热one-hot形式编码的行动作为输入,并生成观测或行动的嵌入;构造隐式变分推理网络,其中,所述隐式变分推理网络的输入为历史背景嵌入状态,其他智能体的信念建模为高斯分布;构造策略网络和状态价值网络并通过强化学习进行训练,其中,所述策略网络和所述状态价值网络的输入为信念嵌入和当前观测状态,所述策略网络和所述状态价值网络的输出为策略分布和状态价值。
2.根据权利要求1中所述的方法,其特征在于,所述构造策略网络和状态价值网络之后,所述方法还包括:通过PPO算法计算损失函数,对所述策略网络和所述状态价值网络进行更新。
3.根据权利要求2所述的方法,其特征在于,所述构造历史背景网络还包括:使用自适应dropout操作在训练和执行过程中丢弃部分不相关的时间步骤;其中,自适应dropout取决于历史观测嵌入序列和当前观测嵌入之间的余弦相似度 ; ;其中, 代表了针对当前观测 所选取的前 个历史步骤的子集;p表示保留的时间步骤的比例, ;当前观测 和历史观测 被嵌入网络 编码,产生当前观测嵌入 和历史观测嵌入序列 ,其中 是历史时间步骤, 是使用的历史长度。
4.根据权利要求1所述的方法,其特征在于,所述构造策略网络和状态价值网络并通过强化学习进行训练具体包括:在训练过程中,策略网络、价值函数网络和动态信念网络同时通过PPO的损失和信念损失进行优化;总损失函数 为: ;其中, 为PPO损失函数, 为信念损失函数; 是 KL 散度, ; 是先验概率分布; 是智能体预测的动作; 是其他智能体预测的动作。
5.一种分布式多智能体合作系统,其特征在于,包括:历史寄存器构造模块,用于通过将过去对局历史中步骤数量的观测状态进行存储以构造观测历史寄存器;所述历史寄存器随着智能体与环境交互的进行,所述历史寄存器持续接受新的历史状态,并将超过容量限制的早期的历史状态丢弃;历史背景网络构造模块,用于构造历史背景网络,其中,所述历史背景网络的输入为当前观测状态,与历史寄存器中的历史状态,通过数据挖掘与融合,所述历史背景网络的输出历史背景嵌入状态;所述历史背景网络构造模块,具体用于利用软注意力机制,根据最近的历史步骤动态学习信念,引入观测嵌入网络 和行动嵌入网络 ;所述观测嵌入网络 和所述行动嵌入网络 接收观测或者以独热one-hot形式编码的行动作为输入,并生成观测或行动的嵌入;隐式变分推理网络构造模块,用于构造隐式变分推理网络,其中,所述隐式变分推理网络的输入为历史背景嵌入状态,其他智能体的信念建模为高斯分布;训练模块,用于构造策略网络和状态价值网络并通过强化学习进行训练,其中,所述策略网络和所述状态价值网络的输入为信念嵌入和当前观测状态,所述策略网络和所述状态价值网络的输出为策略分布和状态价值。
6.根据权利要求5所述的系统,其特征在于,所述训练模块还用于:通过PPO算法计算损失函数,对所述策略网络和所述状态价值网络进行更新。
7.一种电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,处理器执行计算机程序时实现权利要求1~4任一项中所述的分布式多智能体合作方法对应的步骤。
8.一种计算机存储介质,其上存储有计算机程序指令,其特征在于,所述程序指令被处理器执行时用于实现权利要求1~4任一项中所述的分布式多智能体合作方法对应的步骤。