有效
基于天气危险指数的终端区起降容量预测方法
彭瑛、李杰、毛利民、王凯、张朋、郭聪聪、谢华、赵征
南京航空航天大学
摘要
本发明涉及一种基于天气危险指数的终端区起降容量预测方法。基于天气危险指数的终端区起降容量预测方法包括:影响终端区起降容量的管制运行经验抽象;根据管制运行经验抽象,对终端区空域结构进行重新划分;获取终端区起降高峰时段以及初始样本;计算初始样本的特征以及建立模型训练集;依据训练集建立随机森林回归模型;对随机森林回归模型进行验证与预测。依据实际运行经验抽象,对终端区相关的空域结构重新划分建模并提取相关特征,将对流天气影响与时段容量相关联,使用航班历史数据进行回归分析,训练得到终端区起降容量预测模型,进而输入天气预测产品即可输出对应天气下的容量预测。
1.一种基于天气危险指数的终端区起降容量预测方法,其特征在于,包括:获取影响终端区起降容量的管制运行经验抽象;根据管制运行经验抽象,对终端区空域结构进行重新划分;获取终端区起降高峰时段以及初始样本;计算初始样本的特征以及建立模型训练集;依据训练集建立随机森林回归模型;对随机森林回归模型进行验证与预测;所述依据训练集建立随机森林回归模型的方法包括:采用随机森林模型在训练集上建立回归模型;通过性能度量指标和评估方法,对不同规模的随机森林模型进行性能度量;获得最终的随机森林回归模型;所述计算初始样本的特征以及建立模型训练集的方法,即:设研究空域面积为S,被危险天气覆盖区域的面积为S wx ,则空域的 对selectedWAF_set中每个天气避让区产品样本,分别计算A至L空域的WSI值,记为WSI_A、WSI_B、...、WSI_L,其中,WSI为天气危险指数,指研究空域被危险天气覆盖的比例;设M=|peakhour_set|表示高峰小时的总数,第m=1,...,M个高峰小时的开始时间为 结束时间为 则属于第m=1,...,M个高峰小时的天气避让区产品样本集为 由于天气避让区产品的观测时间间隔为6分钟,因此一个小时内包含有10个天气避让区产品样本,即|waf_set m |=10,将这10个天气避让区产品样本按照观测时间先后排序,并将排序后天气避让区产品样本对应的A至L空域的WSI值作为最终模型训练集的特征,记为WSI_A_1、WSI_B_1、...、WSI_L_1、WSI_A_2、WSI_B_2、...、WSI_L_2、...、WSI_A_10、WSI_B_10、...、WSI_L_10;训练集D的规模为M,即集合D中共有M=|peakhour_set|条样本数据,120个特征,目标列为第m=1,...,M个高峰小时的小时起降容量C m ,通过机器学习方法在训练集上建立从天气影响下的空域特征 到小时起降容量C m 的映射f: 即 所述通过性能度量指标和评估方法,对不同规模的随机森林模型进行性能度量的方法中:所述性能度量指标包括均方误差和决定系数;设测试集T包含的数据量为N,y i 为测试样本 的数据标记,f D 为在训练集D上学习得到的模型,则模型在测试集T上的均方误差为:设 为测试集T数据标记的均值 即,则模型在测试集上的决定系数为:所述评估方法为K折交叉验证和自助法;记训练集和测试集构成的数据集为Data_set,进行机器学习前需将数据集Data_set划分为训练集D和测试集T,其中 K折交叉验证法即是将数据集Data_set划分为k个大小相等的互斥子集 在每次训练中用其中k-1个子集作为训练集,剩下的一个作为测试集,重复k次训练和测试,最终返回这k次训练度量性能的平均值作为最终的模型性能度量,其中,在K折交叉验证中,每次的训练样本数量总是比样本总数M少 会导致最终模型由于训练样本规模而产生偏差,自助法在可放回抽样的基础上产生与原样本集规模相同的训练集,设数据集Data_set样本总数为M,对数据集Data_set进行M次可放回抽样,将抽样数据作为训练集进行模型训练;所述获得最终的随机森林回归模型的方法,即:设规模为α的随机森林的预测均方误差和决定系数分别为MSE α 和R 2 α ,则最终随机森林的规模为 其中, 表示取使得均方误差最小的α值, 表示取使得决定系数最大的α值;所述通过终端区起降高峰小时集合获取基于高峰时段的初始样本的方法,即:设WAF为天气避让区产品的样本集合,将第w个WAF样本记为WAF w ,其观测时刻为waftime w ,选择处于高峰时段内的天气避让区数据作为后续特征提取的天气数据样本,即selectedWAF_set={WAF w |waftime w ∈peakhour_set}。
2.如权利要求1所述的基于天气危险指数的终端区起降容量预测方法,其特征在于,所述获取终端区起降高峰时段以及初始样本的方法包括:获取基于历史数据的终端区的小时起降流量样本集;通过终端区小时起降流量样本集获取基于分位数的终端区的高峰小时集合;通过终端区起降高峰小时集合获取基于高峰时段的初始样本。
3.如权利要求2所述的基于天气危险指数的终端区起降容量预测方法,其特征在于,所述获取基于历史数据的终端区的小时起降流量样本集,即:将一天离散为24个小时时段,分别为0:00-1:00、1:00-2:00、...、23:00-24:00,并标号1至24,设一年中第i=1,...,365天第t=1,...,24个时间段的开始时刻为 结束时刻为 终端区内的机场代号为Airport,一年内终端区起降航班集合为Flight_set={f1,...,fN},第f=1,...,F个航班的起飞机场为Dep f ,降落机场为Arr f ,实际起飞时间为ADT f ,实际降落时间为AAT f ;设 则 表示第f个航班属于机场Airport第i天第t时段的起飞航班,同理设 则 表示第f个航班属于机场Airport第i天第t时段的降落航班;机场Airport的终端区第i天第t时段的航班起降流量为 从而得到该终端区的小时起降流量样本集Flow_set={flow i,t |i=1,...,365;t=1,...,24}。
4.如权利要求3所述的基于天气危险指数的终端区起降容量预测方法,其特征在于,所述通过终端区小时起降流量样本集获取基于分位数的终端区的高峰小时集合的方法,即:由终端区的小时起降流量样本集Flow_set,得到第t时段的流量样本集为flow_sett={flow i,t |i=1,...,365},将第t时段的365个流量样本按从小到大排序后生成顺序统计量{flow t(1) ,flow t(2) ,...,flow t(365) },其中flow t(1) ≤flow t(2) ≤...≤flow t(365) ,设第t时段的流量为随机变量X t ,假定X t 服从概率密度为f(x t )的分布,记0<p<1,则满足不等式P(X t <m t,p )≤p,P(X t ≤m t,p )≥p的唯一m t,p 称为第t时段流量的p分位数;设flow t(j) ,j=1,...,365表示顺序统计量{flow t(1) ,flow t(2) ,...,flow t(365) }中的第j个值,其中j为flow t(j) 在顺序统计量中的索引,则第t时段小时流量的p分位数估计为设终端区起降的小时标称容量为C,则终端区的高峰小时集合为 其中m t,95% 表示第t时段流量的0.95分位数。
5.如权利要求4所述的基于天气危险指数的终端区起降容量预测方法,其特征在于,所述对随机森林回归模型进行验证与预测的方法包括:设规模为α final 的随机森林预测模型为 通过自助法产生1000个训练集D 1 ,...,D 1000 和对应的测试集T 1 ,...,T 1000 ,测试随机森林预测模型 的预测值与真实值之间的决定系数,设1000次试验所产生的决定系数为R 2 1 ,...,R 2 1000 ,如果对于任意一次试验都有R 2 i ≥δ,i=1,...,1000,其中δ为相关性的阈值,取0.85,即采用规模为α final 的随机森林作为最终预测模型;设有一待测小时,根据其包含的WAF产品所抽象出的特征为: 则其对应的小时预测容量为







