有效
用于目标环境的信念图构建以及智能体训练的方法和装置
肖刚、叶丰、林金、王彬彬
军事科学院系统工程研究院系统总体研究所
摘要
一种目标环境的信念图构建方法,包括:对于智能体集合中的每个智能体,获取可移动单位集合的状态信息,包括智能体视角下的每个可移动单位的当前状态估计及不确定性;针对目标环境的每个栅格,根据状态信息确定表示智能体视角下的每个可移动单位对栅格的影响的第一影响度,得到第一多个第一影响度;获取智能体集合的特征信息,包括每个智能体的当前位置和探测参数;针对每个栅格,根据特征信息确定表示每个智能体对栅格的影响的第二影响度,得到第二多个第二影响度;根据每个栅格的第一多个第一影响度和第二多个第二影响度,确定指示栅格内存在可移动单位的可能性的信念值,得到目标环境的信念值集合;根据信念值集合构建目标环境的信念图。
1.一种目标环境的信念图构建方法,包括:对于所述目标环境下的智能体集合中的每个智能体,获取所述目标环境下的可移动单位集合的状态信息,所述状态信息包括所述智能体视角下的所述可移动单位集合中每个可移动单位的当前状态估计和相关联的不确定性;针对所述目标环境的每个栅格,根据所述可移动单位集合的状态信息确定表示所述智能体视角下的每个可移动单位对所述栅格的影响的第一影响度,以得到第一多个第一影响度;获取所述智能体集合的特征信息,所述特征信息包括所述智能体集合中每个智能体的当前位置和探测参数;针对所述目标环境的每个栅格,根据所述智能体集合的特征信息确定表示每个智能体对所述栅格的影响的第二影响度,以得到第二多个第二影响度;根据所述目标环境的每个栅格的所述第一多个第一影响度和所述第二多个第二影响度,确定指示所述栅格内存在所述可移动单位的可能性的信念值,以得到所述目标环境的信念值集合;以及根据所述信念值集合构建所述目标环境的信念图,所述信念图包括分别与所述目标环境的各个栅格相关联的色块,其中,色块所关联的栅格的信念值与所述色块的颜色之间具有对应性。
2.根据权利要求1所述的方法,其中,所述确定表示所述智能体视角下的每个可移动单位对所述栅格的影响的第一影响度以得到第一多个第一影响度包括:对于每个智能体,根据每个可移动单位的所述当前状态估计和相关联的不确定性确定所述可移动单位的第一概率密度,以得到多个第一概率密度;将所述多个第一概率密度进行坐标转换,得到多个第二概率密度;根据所述状态信息确定每个可移动单位相对于所述栅格的空间相似性度量,得到多个空间相似性度量;根据每个可移动单位的所述第二概率密度和所述空间相似性度量确定表示所述可移动单位对所述栅格的影响的所述第一影响度,获得每个智能体视角下的所述栅格的多个所述第一影响度,以得到所述第一多个第一影响度。
3.根据权利要求1所述的方法,其中,所述确定表示每个智能体对所述栅格的影响的第二影响度以得到第二多个第二影响度包括:针对所述智能体集合中的每个智能体,根据所述智能体的所述当前位置和探测参数确定所述栅格是否位于所述智能体的探测范围内;响应于确定所述栅格位于所述智能体的探测范围内,将所述第二影响度设置为确定值;响应于确定所述栅格位于所述智能体的探测范围外,获取所述智能体相对于所述栅格的空间相对位置信息,并将所述空间相对位置信息和所述智能体的探测参数一起输入目标激活函数,得到所述目标激活函数输出的函数值作为所述第二影响度,其中,所述目标激活函数输出的最大函数值与所述确定值相等。
4.根据权利要求1至3中任一项所述的方法,其中,所述得到所述目标环境的信念值集合包括:对于每个智能体,对所述智能体视角下的所述栅格的多个第一影响度与所述智能体对所述栅格的影响的第二影响度进行整合,得到所述智能体视角下的所述栅格的多个整合影响度;对每个智能体视角下的所述栅格的多个整合影响度进行平均,得到所述栅格的平均影响度;根据每个栅格的平均影响度确定每个栅格的信念值,得到所述目标环境的所述信念值集合。
5.一种智能体训练方法,包括:在样本采集阶段,执行以下操作:针对当前时间步和下一时间步,根据权利要求1至4中任一项所述的方法构建所述目标环境的相应信念图;将所述相应信念图输入多层卷积神经网络,得到所述多层卷积神经网络输出的相应多个子采样特征向量;利用注意力机制,根据所述相应多个子采样特征向量确定相应融合特征向量作为所述目标环境的当前状态和下一状态;在当前时间步使目标强化学习模型的选定策略与所述目标环境进行交互,获得所述智能体集合在所述当前状态下要采取的动作,所述动作使所述智能体集合中的每个智能体从当前时间步的相应当前位置移动至下一时间步的相应位置;将所述当前状态、所述智能体集合在所述当前状态下要采取的所述动作、所述智能体集合在所述当前状态下采取所述动作所获得的奖励以及所述下一状态作为四元组训练样本存入经验池,其中,一个回合所需的四元组训练样本数量记为第一样本数量;以及响应于所述经验池中新存入的四元组训练样本的数量达到所述第一样本数量的预设倍数,中断当前样本采集阶段的操作并进入模型训练阶段;或者响应于所述经验池中新存入的四元组训练样本的数量未达到所述第一样本数量的预设倍数,继续上述操作,在模型训练阶段,执行以下操作:利用从所述经验池中选择的一批次四元组训练样本更新所述强化学习模型的策略;将经更新的所述强化学习模型的策略作为所述强化学习模型在当前模型训练阶段训练得到的策略;以及将所述当前模型训练阶段训练得到的策略与先前模型训练阶段训练得到的一个或多个策略进行比较,确定所述目标强化学习模型在下一样本采集阶段的选定策略。
6.根据权利要求5所述的方法,其中,在每个回合开始之际,所述目标环境下的所述可移动单位集合中的可移动单位数量和/或所述智能体集合中的智能体数量能够被改变。
7.一种目标环境的信念图构建装置,包括:第一获取模块,配置为对于所述目标环境下的智能体集合中的每个智能体,获取所述目标环境下的可移动单位集合的状态信息,所述状态信息包括所述智能体视角下的所述可移动单位集合中每个可移动单位的当前状态估计和相关联的不确定性;第一确定模块,配置为针对所述目标环境的每个栅格,根据所述可移动单位集合的状态信息确定表示所述智能体视角下的每个可移动单位对所述栅格的影响的第一影响度,以得到第一多个第一影响度;第二获取模块,配置为获取所述智能体集合的特征信息,所述特征信息包括所述智能体集合中每个智能体的当前位置和探测参数;第二确定模块,配置为针对所述目标环境的每个栅格,根据所述智能体集合的特征信息确定表示每个智能体对所述栅格的影响的第二影响度,以得到第二多个第二影响度;第三确定模块,配置为根据所述目标环境的每个栅格的所述第一多个第一影响度和所述第二多个第二影响度,确定指示所述栅格内存在所述可移动单位的可能性的信念值,以得到所述目标环境的信念值集合;以及构建模块,配置为根据所述信念值集合构建所述目标环境的信念图,所述信念图包括分别与所述目标环境的各个栅格相关联的色块,其中,色块所关联的栅格的信念值与所述色块的颜色之间具有对应性。
8.一种智能体训练装置,包括:样本采集模块,包括:第一单元,用于针对当前时间步和下一时间步,根据权利要求1至4中任一项所述的方法构建所述目标环境的相应信念图;第二单元,用于将所述相应信念图输入多层卷积神经网络,得到所述多层卷积神经网络输出的相应多个子采样特征向量;第三单元,用于利用注意力机制,根据所述相应多个子采样特征向量确定相应融合特征向量作为所述目标环境的当前状态和下一状态;第四单元,用于在当前时间步使目标强化学习模型的选定策略与所述目标环境进行交互,获得所述智能体集合在所述当前状态下要采取的动作,所述动作使所述智能体集合中的每个智能体从当前时间步的相应当前位置移动至下一时间步的相应位置;第五单元,用于将所述当前状态、所述智能体集合在所述当前状态下要采取的所述动作、所述智能体集合在所述当前状态下采取所述动作所获得的奖励以及所述下一状态作为四元组训练样本存入经验池,其中,一个回合所需的四元组训练样本数量记为第一样本数量;以及第六单元,用于响应于所述经验池中新存入的四元组训练样本的数量达到所述第一样本数量的预设倍数,中断当前样本采集阶段的操作并进入模型训练阶段;以及第七单元,用于响应于所述经验池中新存入的四元组训练样本的数量未达到所述第一样本数量的预设倍数,继续上述操作,模型训练模块,包括:第八单元,用于利用从所述经验池中选择的一批次四元组训练样本更新所述强化学习模型的策略;第九单元,用于将经更新的所述强化学习模型的策略作为所述强化学习模型在当前模型训练阶段训练得到的策略;以及第十单元,用于将所述当前模型训练阶段训练得到的策略与先前模型训练阶段训练得到的一个或多个策略进行比较,确定所述目标强化学习模型在下一样本采集阶段的选定策略。
9.一种电子设备,包括:至少一个处理器;以及与所述至少一个处理器通信连接的存储器;其中所述存储器存储有计算机程序,所述计算机程序在被所述至少一个处理器执行时实现根据权利要求1-6中任一项所述的方法。
10.一种存储有计算机程序的非瞬时计算机可读存储介质,其中,所述计算机程序在被处理器执行时实现根据权利要求1-6中任一项所述的方法。



