1.一种城市公共服务设施选址方法,其特征在于,包括:步骤1,收集目标区域的设施数据,其中,所述设施数据包括现有设施分布数据和设施服务缺口数据;步骤2,将城市公共服务设施选址问题建模为具有距离衰减效应与容量约束的连续最大覆盖问题,目标函数为最大化满足的需求量;所述步骤2具体包括:步骤2.1,将目标区域建模为连续空间,存在由 个需求点构成的集合 : ;其中, 表示第 个需求点, 是需求点坐标, 是需求量;步骤2.2,假设连续空间中有 个待规划空间位置的服务设施构成的集合 : ;其中, 表示第 个服务设施, 是服务设施的坐标, 为设施可提供的总服务量, 为设施的服务范围;步骤2.3,当一个设施的服务范围覆盖多个需求点时,则将该设施提供的服务量将根据权重分配给每个需求点: ;其中, 表示设施 为需求点 提供的服务量,权重 , 表示需求点与设施之间的距离,并且 , 是距离衰减效应函数;步骤2.4,求 个设施的选址位置,使得满足的需求量最大化作为目标函数 ;其中, 表示所有服务设施的空间位置集合;步骤3,使用多尺度格网划分目标区域,构建多尺度空间决策树,将其作为智能体的选址环境;所述步骤3具体包括:步骤3.1,使用不同尺度格网划分连续空间,构成多尺度空间决策树,多尺度空间决策树中每个树节点表示一个空间区域,包含所表示区域的属性信息,称为区域节点,每细分一次,每个区域节点均产生四个子节点,节点所表示的区域的边长便减少一半、面积变为原来的四分之一;步骤3.2,基于这个可无限细分的多尺度空间决策树,将连续空间区域无限细分,从而完整表示整个连续空间区域;步骤4,令多个智能体分别控制多个设施的选址规划,设置智能体的属性,其中,所述属性包括状态空间、动作空间和奖励函数;步骤5,基于目标函数,令多智能体与多尺度空间决策树进行交互,使用近端策略优化方式来优化智能体网络参数,得到最优选址策略;步骤6,使用最优选址策略在多尺度空间决策树中进行选址规划,得到城市公共服务设施选址方案。
2.根据权利要求1所述的方法,其特征在于,所述步骤4具体包括:步骤4.1,令每一个设施均由一个智能体控制,每个智能体由一套Actor-Critic网络控制,智能体通过Actor网络输出动作来与多尺度空间决策树进行交互;步骤4.2,设置每一个智能体的状态空间、动作空间、奖励函数。
3.根据权利要求2所述的方法,其特征在于,所述步骤5具体包括:步骤5.1,基于目标函数,当多智能体与多尺度空间决策树每次交互时,智能体基于当前层级区域节点信息,输出去往下一层级四个子区域节点的概率,并从中采样一个子区域节点进行移动,根据移动后的智能体对需求点的服务情况计算奖励;步骤5.2,将每次交互的记录表示为[状态,动作,奖励,下一时刻状态],通过多次交互可形成一个交互序列,完成一次设施选址规划;步骤5.3,对于每个智能体均采用近端策略优化方式更新Actor-Critic网络参数,通过对交互序列进行多次学习来更新Actor-Critic网络参数,并通过限制策略更新幅度保证多智能体选址策略学习的稳定性,从而优化智能体的选址策略;步骤5.4,重复步骤5.1至步骤5.3,得到最优选址策略。
4.根据权利要求3所述的方法,其特征在于,所述步骤5.2具体包括:步骤5.2.1,每次交互时,将每个智能体的状态表示为: ;其中, 是智能体的空间位置坐标, 是智能体与所有需求点依据需求量计算的加权重心位置之间的距离, 表示智能体与 个需求点之间的距离, 表示 个需求点在当前时间步中的需求量, 表示智能体 与其它 个智能体之间的距离;步骤5.2.2,设定每个智能体有四个可选动作,可选动作为从四个子区域节点中选择一个进行设施投放,将智能体的动作空间表示为: ;其中, 表示一个动作,控制智能体在 和 方向上的移动, 表示智能体的移动步长, 随智能体在多尺度空间决策树中的序贯决策而逐级减半;步骤5.2.3,设定每个智能体在时间步 获得的奖励等于当前时间步决策得到的奖励减去上一时间步决策得到的奖励: ;其中,初始奖励 根据智能体的初始位置进行计算;步骤5.2.4,在每次交互时,将智能体在当前空间位置通过动作决策转移到另一个空间位置的过程,以及过程伴随着需求点被提供的服务量的变化、智能体、需求点之间相对空间位置的变化作为下一时刻状态;步骤5.2.5,记录移动后的状态、动作、奖励及下一状态,形成决策单元数据,序贯决策产生的决策单元序列构成决策轨迹数据,将其作为交互序列。
5.根据权利要求4所述的方法,其特征在于,所述步骤5.3具体包括:步骤5.3.1,通过反向递归方式和时序差分误差计算广义优势估计函数,基于广义优势估计函数评估动作优劣性,其中,所述广义优势估计函数的表达式为 ; ;其中, 表示时序差分误差, 是折扣因子,用于控制对未来奖励的重视程度, 是一个超参数, 表示即时奖励, 是状态价值函数, 表示t+1时刻的状态价值, 表示t时刻的状态价值;步骤5.3.2,基于广义优势估计函数构建每个智能体的目标优化函数 ;其中, 表示在当前批次收集的智能体轨迹数据上计算平均值,从而得到经验期望, 表示重要性采样比例,通过使用旧策略 收集的经验数据来更新策略 , 是一个超参数,用于限制策略的更新幅度, 表示动作;步骤5.3.3,在目标优化函数中添加熵正则项 ;其中, 为超参数, ;步骤5.3.4,将每个智能体表示为 ,其中, 表示智能体i的策略网络, 表示智能体i的价值网络, 表示策略网络参数, 表示价值网络参数,通过正交初始化方法初始化网络权重,设置策略网络和价值网络的学习率分别为 和 ,并使用Adam优化器更新网络参数;步骤5.3.5,设置训练回合总数 以及每回合的决策时间步数 ,设置针对每一批次数据的学习次数 ,通过梯度上升优化策略网络参数 ,从而得到最优选址策略 。