1.一种单交叉口信号控制模型迁移至目标环境的方法,其特征在于,包括以下步骤:S1.搭建单交叉口信号控制模型的DQN深度强化学习框架;S2.对控制模型的迁移环境进行交叉口参数匹配以及DQN参数校准,将控制模型迁移至目标环境;S21.判断迁移环境交叉口参数是否同时满足:进口道数与源训练环境进口道数一致、交叉口进口道除右转外可转向范围是否包括源训练环境所需转向范围、进口道可获取观测数据包源控制模型所需交通状态、独立左转车道数大于等于源训练环境的独立左转车道数;若是,则初步满足交叉口参数匹配;S22.选取交叉口参数匹配的迁移环境,分别对DQN参数动作和交通状态校准;动作校准为:判断迁移环境交叉口结构渠化与信号机是否支持控制模型的动作,若支持则通过动作校准;交通状态校准为:校核目标交叉口可提取到的交通状态类型及维度是否与控制模型输入所需的交通状态类型及维度一致,如果是,则满足交通状态校准;S23.若步骤S22的DQN参数通过校准,则迁移环境为目标环境;S3.目标环境下对控制模型优化训练;S4.检测周期内交通流特征参数的异常天数比例是否超过阈值,如果是,则继续步骤S3,否则,不对控制模型进行优化训练。
2.根据权利要求1所述的一种单交叉口信号控制模型迁移至目标环境的方法,其特征在于,步骤S1中:S11.构建交通环境和控制模型;S12.定义DQN的参数:交通状态、动作、奖励。
3.根据权利要求1所述的一种单交叉口信号控制模型迁移至目标环境的方法,其特征在于,步骤S2中将控制模型迁移至目标环境中的具体方法为:基于控制模型在源训练环境下得到的先验知识,对目标环境中原始控制模型的神经网络权重进行初始化设置,初始化设置后的原始控制模型即为迁移至目标环境的控制模型。
4.根据权利要求1所述的一种单交叉口信号控制模型迁移至目标环境的方法,其特征在于,步骤S3中,对控制模型优化训练的具体步骤包括:S31.初始化控制模型神经网络参数;S32.将实时交通状态输入到控制模型的神经网络中,控制模型根据神经网络输出的Q值在动作集合中以 策略选择动作 a ;S33.信号机执行动作 a ,控制相位变化,相位实时状态作用于交叉口环境中使交通状态发生变化,将当前交通状态 和下个时间步的交通状态 、动作 a 、奖励值 作为一个四元组 样本存储在经验池中;S34.控制模型获取实时交通状态以及奖励函数值进行选择动作 a 的同时,随机在经验池中抽取小批量样本作为训练数据,用所述训练数据来训练更新神经网络的权重值;S35.重复上述S31-S34步骤,检测控制模型训练过程的DQN奖励函数值,直至奖励函数值的标准差变化小于阈值,则控制模型收敛,结束控制模型的优化训练。
5.根据权利要求1所述的一种单交叉口信号控制模型迁移至目标环境的方法,其特征在于,步骤S4中:检测周期内交通流特征包括检测交通流量 TF 或各进口道左转车辆转向比例 R 。