1.一种基于强化学习的网络攻防仿真方法,其特征在于,所述仿真方法包括:根据待仿真网络攻防的攻防需求生成仿真网络拓扑结构,并根据网络环境建立网络攻防环境模型,所述仿真网络拓扑结构中包括:所述仿真网络拓扑结构的拓扑节点的节点属性;根据所述仿真网络拓扑结构和网络攻防环境模型获取对应的攻防算法模型;根据所述仿真网络拓扑结构和网络攻防环境模型通过渲染获取网络场景图,根据所述攻防算法模型获取参与所述攻防仿真的智能体的行动信息,并在所述网络场景图中展示所述行动信息;获取所述攻防仿真的仿真结果;所述根据所述仿真网络拓扑结构和网络攻防环境模型获取对应的攻防算法模型的步骤,包括:根据所述仿真网络拓扑结构和网络攻防环境模型获取对应的第一已训练算法模型;或者,根据所述仿真网络拓扑结构和网络攻防环境模型获取对应的未训练算法模型,对所述训练算法模型进行训练,获取第二已训练算法模型。
2.如权利要求1所述的仿真方法,其特征在于,所述根据待仿真网络攻防的攻防需求生成仿真网络拓扑结构,包括:获取所述攻防需求对应的攻防数据,所述攻防数据包括:文本型参数数据、表格型参数数据;根据所述攻防数据生成仿真网络拓扑结构。
3.一种基于强化学习的网络攻防仿真系统,其特征在于,所述仿真系统包括:拓扑结构和环境模型构建模块,用于根据待仿真网络攻防的攻防需求生成仿真网络拓扑结构,并根据网络环境建立网络攻防环境模型,所述仿真网络拓扑结构中包括:所述仿真网络拓扑结构的拓扑节点的节点属性;攻防算法模型获取模块,用于根据所述仿真网络拓扑结构和网络攻防环境模型获取对应的攻防算法模型;所述根据所述仿真网络拓扑结构和网络攻防环境模型获取对应的攻防算法模型,包括:根据所述仿真网络拓扑结构和网络攻防环境模型获取对应的第一已训练算法模型;或者,根据所述仿真网络拓扑结构和网络攻防环境模型获取对应的未训练算法模型,对所述训练算法模型进行训练,获取第二已训练算法模型;展示模块,用于根据所述仿真网络拓扑结构和网络攻防环境模型通过渲染获取网络场景图,根据所述攻防算法模型获取参与所述攻防仿真的智能体的行动信息,并在所述网络场景图中展示所述行动信息;仿真结果获取模块,用于获取所述攻防仿真的仿真结果。
4.如权利要求3任一项所述的仿真系统,其特征在于,所述根据待仿真网络攻防的攻防需求生成仿真网络拓扑结构,包括:获取所述攻防需求对应的攻防数据,所述攻防数据包括:文本型参数数据、表格型参数数据;根据所述攻防数据生成仿真网络拓扑结构。
5.一种电子设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现如权利要求1-2中任一项所述的基于强化学习的网络攻防仿真方法。
6.一种非暂态计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1-2中任一项所述的基于强化学习的网络攻防仿真方法。