1.面向多智能体对抗优化的分层策略学习系统,其特征在于,包括步骤:S1:构建环境模型和实体集合,利用多智能体强化学习获取多轮对抗时间步状态、动作及约束信息,并存入轨迹缓冲区;S2:基于轨迹缓冲区根据奖励、距离或约束事件变化划分时间区间,在时间区间内构建实体关系图得到协同群组,并在时间区间与协同群组组合上生成事件序列;S3:利用事件序列编码得到场景特征向量,将场景特征向量与方案模板库中模板匹配选定目标模板,并通过评价网络结合规则描述向量确定事件到时间槽位、角色槽位和资源槽位的映射结果;S4:依据目标模板及其事件到槽位映射结果生成结构化方案数据,根据规则描述向量对结构化方案数据进行一致性检查,并将检查后的结构化方案转换为按时间排序的中间脚本指令序列。
2.根据权利要求1所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:步骤S1包括,在每一轮对抗仿真过程中,对每一时间步同时采集全局状态数据、各实体的局部观测数据、各实体的动作指令、各实体的即时奖励数据、约束事件标记以及资源占用信息,并将上述数据按照对抗轮次索引和时间步索引组合形成记录单元,顺序存入轨迹缓冲区。
3.根据权利要求2所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:步骤S2包括,基于轨迹缓冲区中的各时间步记录,按对抗轮次计算反映总体收益变化的奖励序列、反映实体空间聚合程度的平均距离序列以及反映规则触发情况的约束事件计数序列,根据至少一类序列中相邻时间步的变化幅度超过预设阈值的判定结果自动确定阶段起止时间,获得具有明确开始与结束时间的时间区间集合。
4.根据权利要求3所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:步骤S2还包括,在每一时间区间内,以实体集合中的各实体作为节点,根据实体在时间区间内的空间邻近情况以及行为类别一致情况构建实体关系图,通过对实体关系图进行连通分量划分和边密度判断获得协同群组集合,并在每一时间区间与每一协同群组的组合上生成事件记录,事件记录至少包含时间区间信息、协同群组标识、主导行为类别以及约束事件类别,由此形成按时间顺序排列的事件序列。
5.根据权利要求4所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:步骤S3包括,将事件序列中的每一事件按照时间区间长度、在整轮对抗中的相对位置、协同群组规模、主导行为类别以及约束事件类别信息编码为定长事件特征向量,并按照事件在时间上的先后顺序对事件特征向量进行顺序编码,得到唯一对应于每一轮对抗过程的场景特征向量,场景特征向量用于与方案模板库中的模板特征向量进行匹配。
6.根据权利要求5所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:方案模板库包括多个预设模板,每一模板包括与场景特征向量相匹配的模板特征向量、描述关键时间结构的时间槽位集合、描述角色和协同关系的角色槽位集合以及描述资源配置行为的资源槽位集合,并在模板内部为时间槽位、角色槽位和资源槽位预先给出顺序约束、资源容量约束和角色兼容约束的形式化约束信息。
7.根据权利要求6所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:步骤S3还包括,将场景特征向量与每一模板特征向量进行相似度计算,从中选取相似度满足预设条件的模板构成候选模板集合,在候选模板集合中针对每一模板生成多个事件到时间槽位、角色槽位和资源槽位的候选映射,将场景特征向量、模板特征向量、候选映射结构特征以及规则描述向量共同输入评价网络,得到用于区分不同候选映射优劣的评分数值,并选取评分最高的候选映射作为事件到槽位的映射结果。
8.根据权利要求7所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:步骤S4包括,在选定目标模板之后,根据事件到时间槽位映射结果,将映射到同一时间槽位的多个事件的起始时间与结束时间归并为时间字段集合中的时间区间信息,并保持与事件序列的引用关系;同时根据事件到角色槽位映射结果和协同群组集合,将各角色槽位对应的实体标识及其类型信息填充到角色字段集合中,并记录角色与时间字段之间的关联。
9.根据权利要求8所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:步骤S4还包括,根据事件到资源槽位映射结果和轨迹缓冲区中的资源使用记录,提取每一资源槽位对应的资源类型、资源数量、资源来源对象以及资源作用对象,整理为资源指令字段集合中的资源指令条目,对时间连续且参数一致的资源指令进行合并,对时间重叠但作用对象不同的资源指令分别保留,并在每一资源指令条目中记录其对应的时间字段引用信息和角色字段引用信息。
10.根据权利要求9所述的面向多智能体对抗优化的分层策略学习系统,其特征在于:步骤S4还包括,对结构化方案数据中的时间字段集合、角色字段集合和资源指令字段集合与规则描述向量进行一致性检查,在确认字段之间不存在违反时间顺序约束、资源容量约束和角色兼容约束的矛盾关系后,将结构化方案数据依次转换为按时间排序的脚本指令序列,每一脚本指令包括指令类型、目标标识、参数集合和时间触发条件,并附加对应事件记录和时间区间的溯源标记。