1.一种基于深度强化学习的非稳态人群疏散路径规划方法,其特征在于,所述方法包括:采用离散网格法对非稳态疏散环境进行简化建模,将非稳态疏散环境抽象为二维区域,每个网格代表一个区域,所述网格包括障碍物、出口、危险源以及人群密度信息;对危险源的动态扩散特性进行建模,得到危险源扩散模型;基于所述危险源扩散模型实时更新火源的位置和范围模拟火灾的动态发展过程;在所述火灾的动态发展过程中,将人员作为智能体,智能体并按照势能场引导的决策规则进行移动,以最大化疏散人数的同时最小化疏散时间为目标函数,根据商场的实际情况和智能体移动规律确定约束条件,利用所述目标函数和约束条件构建非稳态人群疏散路径规划模型;采用APF-MADDPG算法,将路径规划过程转化为马尔科夫决策过程,并设计状态特征结合势能场方法构建深度强化学习框架;利用深度强化学习框架训练所述非稳态人群疏散路径规划模型,得到训练好的非稳态人群疏散路径规划模型;根据所述训练好的非稳态人群疏散路径规划模型实现非稳态人群疏散路径规划;所述深度强化学习框架包括非稳态环境、Actor-Critic网络训练模块和基于势能场的动态感知模块和动态经验池;所述Actor-Critic网络训练模块采用Actor-Critic 架构,动作网络根据状态S生成动作A,评价网络设计复合奖励函数进行奖励值计算,引入Target Actor和Target Critic作为目标网络,通过软更新机制从动作网络和评价网络复制参数;对危险源的动态扩散特性进行建模,得到危险源扩散模型,包括:对危险源的动态扩散特性进行建模,设危险源集合为 ,障碍物集合为 ,危险源扩散时间间隔为 ,经历 个扩散时间间隔的危险源集合为 ,通过邻域函数 搜索相邻区域,则危险源扩散模型为: 。
2.根据权利要求1所述的方法,其特征在于,所述势能场引导的决策规则为智能体在每个时间步长内,感知自身所在网格及相邻网格的状态信息,计算合势能梯度,选择相邻区域中合势能最小的区域作为下一位置,若存在多个等价方向,则优先选择人群密度最低的区域,实现对火灾的规避和向出口的移动;其中,智能体位置更新公式为 ,速度 由合势能梯度归一化后确定,即 ,其中 为智能体最大移动速度 , 表示第 个智能体;所述计算合势能梯度为: ;其中, 表示第 个智能体所受到的合势能梯度, 表示第 个智能体所受到的来自危险源的排斥势能梯度, 表示第 个智能体所受到来自出口的吸引势能梯度, 表示第 个危险源, 表示第 个出口。
3.根据权利要求1所述的方法,其特征在于,利用所述目标函数和约束条件构建非稳态人群疏散路径规划模型,包括:利用所述目标函数和约束条件构建非稳态人群疏散路径规划模型为: ;约束条件: , , ;其中, 表示智能体总数, 表示第 个智能体在时间 所处的位置, 表示疏散环境中的出口, 表示 个智能体全部离开疏散环境的时间, 表示正则判断式为真, 表示疏散区域中的第 个网格区域, 表示疏散区域中的第 个网格区域为障碍物, 表示疏散区域中的第 个网格区域为危险源, 表示疏散区域中的第 个网格区域为出口。
4.根据权利要求1所述的方法,其特征在于,所述复合奖励函数为: ;其中, 表示智能体抵达目标点时出发全额奖励, 表示势能场引导项,采用动态势能差机制引导智能体沿势能下降方向移动引导智能体朝着目标前进, 表示风险规避模块由火灾排斥项, 表示碰撞惩罚项, 表示时间惩罚项。
5.根据权利要求4所述的方法,其特征在于,所述评价网络的目标函数为: ; ;其中, 表示Critic 网络的目标相关的目标量, 表示从经验回放缓冲区D中采样得到的状态 、动作 、奖励 、下一状态 这些数据样本上的期望, 表示目标Q值, 表示状态 在做动作 后,后续按照策略获得的累计奖励期望, 表示用于正则化的系数, 表示 Critic网络的参数, 表示方差正则化的系数, 表示方差, 表示 函数获得的累计奖励值, 表示智能体获得的即时奖励, 表示折扣因子, 表示目标Q网络的输出, 表示执行动作 后转移进入的下一状态, 表示目标动作网络输出的动作;所述动作网络的目标函数为: ;其中, 表示期望, 表示对于动作的梯度算子, 表示动作网络参数的梯度算子, 表示第 个动作网络输出的策略, 表示动作网络 对应的输入, 表示用于控制KL散度正则化强度的参数, 表示旧策略, 表示新策略。
6.根据权利要求1所述的方法,其特征在于,所述基于势能场的动态感知模块定义排斥势能场 描述动态危险源和障碍物对智能体的排斥作用,当距离 小于阈值 时, ,大于阈值时为0;吸引势能场 描述出口对智能体的吸引作用,其中, 表示斥力系数, 表示吸引力系数, 表示第 个智能体所处坐标, 表示第 个出口所处坐标。
7.根据权利要求1所述的方法,其特征在于,所述动态经验池用于设置经验回放机制,基于TD误差绝对值δ设置采样权重 ,对经验在梯度更新时的权重定义为 , 同时,采用动态容量经验池,经验池容量随训练进度动态扩展,计算公式为 ,其中, 表示经验存储池的初始容量,经验回放缓冲区采用“字典-队列”的复合架构。
8.一种基于深度强化学习的非稳态人群疏散路径规划装置,其特征在于,所述装置包括:环境建模模块,用于采用离散网格法对非稳态疏散环境进行简化建模,将非稳态疏散环境抽象为二维区域,每个网格代表一个区域,所述网格包括障碍物、出口、危险源以及人群密度信息;危险源动态扩散特性建模,用于对危险源的动态扩散特性进行建模,得到危险源扩散模型;基于所述危险源扩散模型实时更新火源的位置和范围模拟火灾的动态发展过程;对危险源的动态扩散特性进行建模,得到危险源扩散模型,包括:对危险源的动态扩散特性进行建模,设危险源集合为 ,障碍物集合为 ,危险源扩散时间间隔为 ,经历 个扩散时间间隔的危险源集合为 ,通过邻域函数 搜索相邻区域,则危险源扩散模型为: ;构建非稳态人群疏散路径规划模型建模,用于在所述火灾的动态发展过程中,将人员作为智能体,智能体并按照势能场引导的决策规则进行移动,以最大化疏散人数的同时最小化疏散时间为目标函数,根据商场的实际情况和智能体移动规律确定约束条件,利用所述目标函数和约束条件构建非稳态人群疏散路径规划模型;人群疏散路径规划建模,用于采用APF-MADDPG算法,将路径规划过程转化为马尔科夫决策过程,并设计状态特征结合势能场方法构建深度强化学习框架;利用深度强化学习框架训练所述非稳态人群疏散路径规划模型,得到训练好的非稳态人群疏散路径规划模型;根据所述训练好的非稳态人群疏散路径规划模型实现非稳态人群疏散路径规划;所述深度强化学习框架包括非稳态环境、Actor-Critic网络训练模块和基于势能场的动态感知模块和动态经验池;所述Actor-Critic网络训练模块采用Actor-Critic 架构,动作网络根据状态S生成动作A,评价网络设计复合奖励函数进行奖励值计算,引入Target Actor和TargetCritic作为目标网络,通过软更新机制从动作网络和评价网络复制参数。