1.一种网联车探测状态感知的交叉口强化学习信号控制方法,其特征在于,包括如下步骤:步骤1,在网联自动驾驶车辆与非自动驾驶车辆共存的场景下,构建交通系统仿真环境,在所述仿真环境中将所述网联自动驾驶车辆作为移动传感器,获取交通流状态信息;步骤2,使用改进的离散交通流状态编码,将所述网联自动驾驶车辆获取的交通流状态信息转化为检测掩码矩阵、位置矩阵和速度矩阵;具体过程如下:令步骤1构建的交通系统仿真环境中各交叉口的编号为j,j=1,2,…,则交叉口j获取的交通流状态信息转化为检测掩码矩阵D j 、位置矩阵P j 和速度矩阵V j ;根据车辆平均长度,将交叉口各进口道上每个车道划分为若干个大小相同的道路单元,每个道路单元与检测掩码矩阵中的元素一一对应,每个道路单元与位置矩阵中的元素一一对应,每个道路单元与速度矩阵中的元素一一对应;检测掩码矩阵中的元素值表征其所对应的道路单元是否能够被进口道上的网联自动驾驶车辆观测到,若能够被至少一辆网联自动驾驶车辆观测到,则该元素值为1,否则为0;位置矩阵表征进口道上所有能够被网联自动驾驶车辆观测到的道路单元内是否有车,若某道路单元能够被网联自动驾驶车辆观测到,且该道路单元内有车,则该道路单元在位置矩阵中对应的元素值为1;若某道路单元能够被网联自动驾驶车辆观测到,且该道路单元内无车,则该道路单元在位置矩阵中对应的元素值为0;若某道路单元不能够被至少一辆网联自动驾驶车辆观测到,则该道路单元在位置矩阵中对应的元素值为0;速度矩阵表征被网联自动驾驶车辆观测到的道路单元内车辆的位置及速度,若某道路单元能够被网联自动驾驶车辆观测到,且该道路单元内有车,则该道路单元在速度矩阵中对应的元素值为道路单元内车辆的速度;除此之外,速度矩阵中其他元素值均为0;步骤3,使用马尔可夫决策过程定义交通系统的智能体、状态变量、动作和目标;具体过程如下:定义智能体为交通信号灯,状态变量由检测掩码矩阵、位置矩阵和速度矩阵构成,其中,检测掩码矩阵由网联自动驾驶车辆的位置与探测半径决定,位置矩阵和速度矩阵的确定基于网联自动驾驶车辆能够探测的范围以及网联自动驾驶车辆能够探测的范围内车辆的状态;定义智能体的动作为信号相位是否变化,根据预先设定的相位情况,智能体的两种动作选择分别为:切换到下一相位,即a=1;保持当前相位,即a=0;智能体每次动作的时间间隔为15秒,相位总时长不得超过60秒;定义智能体的目标为所有车辆等待时间之和最小,智能体根据即时的状态以所有车辆的等待时间之和为奖励函数选择自己的动作,其中,单车等待时间具体公式为:其中,W i (t)表示车辆i在时刻t的等待时间,单位秒;Δt表示步长间隔,单位秒;v i (t)表示车辆i在时刻t的速度,单位米每秒;步骤4,采用深度策略梯度算法训练智能体,将状态变量作为深度策略梯度算法中策略网络的输入,策略网络的输出为智能体选择各动作的概率,经过训练后的智能体即能够根据网联自动驾驶车辆获取的交通流状态信息选择相位切换动作;所述策略网络包括依次连接的第一卷积层、第一最大池化层、第二卷积层、第二最大池化层、第三卷积层、第三最大池化层、第一全连接层和第二全连接层;其中,第一、第二、第三卷积层的卷积核大小依次为3×3、5×5、3×3,通道数依次为32、128、512;第一、第二、第三最大池化层的采样核大小依次为2×2、2×2、3×3;第一、第二全连接层的单元数依次为512、256;所述策略网络的输入即第一卷积层的输入维数为m×n×3,其中,m=交叉口数量×每个交叉口进口道数量×每个进口道车道数量,n=车道长度/车道上划分的道路单元的长度,3表示检测掩码矩阵、位置矩阵和速度矩阵这三个矩阵;所述深度策略梯度算法中,用θ表示策略网络的参数,深度策略梯度算法的思想是带参数θ的最优策略满足等式:状态s选定时,各个动作选择概率总和为1;S表示状态集合,π表示策略,a表示动作;用J θ 表示给定策略π时,状态s的价值函数,对其求梯度: 表示对J θ (t)中的θ求梯度, 表示给定策略π时,变量 的期望值,γ t 表示时刻t的折扣率,G t 表示从时刻t到回合终止智能体积累的奖励之和,a t 表示时刻t的动作,s t 表示时刻t的状态,θ t 表示时刻t的参数,T表示回合终止的时间;利用学习率因子α迭代更新参数θ以获得最优策略:其中,θ t+1 表示时刻t+1的参数,α=0.0004;带参数θ的策略表示为:其中,h表示动作偏好函数,a′表示动作;利用策略网络迭代θ去逼近最优策略,同时将最优策略转化为概率输出,策略网络经过训练后即能够根据智能体交通信号灯获取的交通状态流选择相位切换动作。