1.一种基于TBM运行数据的不良地质条件识别与预测方法,其特征在于,包括以下步骤:步骤1,获取TBM运行数据与地勘资料数据;步骤2,将所述TBM运行数据与所述地勘资料进行预处理,得到预处理后的数据;步骤3,基于所述预处理后的数据进行特征变量设计,筛选出与目标相关的变量;步骤4,基于与目标相关的变量,建立基于遗传编程的不良地质条件识别模型,并求得良好地质与不良地质的划分函数H(X);步骤5,根据所述H(X)判断TBM当前位置的地质情况,其中,步骤3的具体步骤为:步骤3-1,根据皮尔逊相关性过滤出与目标相关但是不冗余的变量:式中,cov(X,Y)表示X和Y的协方差,σ X 和σ Y 分别表示X和Y的标准差;步骤3-2,基于排序特征重要性进一步筛选与目标相关的变量,该步骤依赖于机器学习算法的选择,可采用的机器学习算法至少包括支持向量机、k最邻近法、随机森林,步骤3-2的具体过程为:步骤3-2-1,使用h代表所选用的机器学习算法,计算h在数据集D上的分类错误率e orig ,为测试数据集D中第j个变量的特征重要性,为第j个变量里每个元素加入随机小扰动∈,记此时的测试数据集为D * ;步骤3-2-2,计算h在所述数据集D * 上的分类错误率e perm,j ,则第j个变量的特征重要性为|e perm,j -e orig |,可得|e perm,j -e orig |越大,表示变量对预测结果影响越大,则对应变量重要性越高;步骤3-2-3,从数据集D中整列删除特征重要性排序低的变量,步骤4的具体过程为:遗传编程首先基于先验知识或随机生成若干棵初始语义树,所述初始语义树通过复制、交叉、变异生成下一代种群,种群的演化依赖于个体适应度函数F(X)的计算,当F(X)超过预设值,输出当前语义树表达式H(X),即为良好地质与不良地质的划分函数H(X),遗传编程以语义树的形式表达符号运算结果,其中树的内部节点表示运算符号,叶子结点表示变量或常量值,F(X)取为优化目标函数f(X)的函数,假设f(X)为针对求目标函数最大值的优化问题,则为满足F(X)取非负值的要求:式中,C min 为预先指定的相对较小的数,F(X)的大小被用来确定不同个体被遗传到下一代群体中的概率,F(X)的值越大,则对应个体被遗传到下一代的概率也越大,反之,F(X)的值越小,则该个体被遗传到下一代的概率越小,若当前语义树的F(X)值超过预设值,则输出该语义树对应的表达式H(X),即为待求得良好地质与不良地质的划分:步骤5的具体过程为:将新获取的TBM运行数据与地质数据带入所述H(X),从而判断当前TBM是否处于不良地质体中。
2.根据权利要求1所述的基于TBM运行数据的不良地质条件识别与预测方法,其特征在于:其中,步骤1的具体过程为:通过可编程逻辑控制器以固定频率采集TBM上所有传感器数据,获得所述TBM运行数据,所述TBM运行数据至少包括总推力、刀盘扭矩、刀盘转速、贯入度以及掘进速度,基于施工前地质勘探资料获得所述地勘资料数据,所述地勘资料数据至少包括岩性、围岩分级。
3.根据权利要求1所述的基于TBM运行数据的不良地质条件识别与预测方法,其特征在于:其中,步骤2中,所述预处理的具体步骤为:步骤2-1,使用缺失值所在数据列的均值填补缺失的所述TBM运行数据;步骤2-2,使用3σ准则和盖帽法删除所述TBM运行数据中的异常值;步骤2-3,TBM掘进不同阶段划分,并取各个变量在稳定段内的均值构成TBM运行参数数据集;步骤2-4,使用最近邻插值法处理所述地勘资料数据,并扩充所述TBM运行参数数据集;步骤2-5,分别使用0-1标准化与独热编码分别处理连续变量与离散变量。
4.根据权利要求3所述的基于TBM运行数据的不良地质条件识别与预测方法,其特征在于:其中,步骤2-1的具体过程为:假设输入数据为 的矩阵,满足:式中,x ij 表示矩阵中第i行第j列元素,若x ij 元素缺失数据,且第j列共有p个元素缺失数据(p<m),则步骤2-2的具体过程为:验证连续变量的偏度S与峰度K:式中,μ j 是第j个变量的均值,σ j 是第j个变量的标准差,对于满足-3≤S≤3,-7≤K≤7的变量,使用3σ准则删除取值在(μ j -3σ j ,μ j +3σ j )区间外的异常值,对于其他情况,使用盖帽法整行删除数据框里99%以上和1%以下的数据点,步骤2-4的具体过程为:若已知x i-1 ,x i-1 处对应的地勘数据分别为f(x i-1 ),f(x i-1 ),且存在x i 满足 则令f(x i )=f(x i-1 ),步骤2-5的具体过程为:利用0-1标准化将连续变量缩放到[0,1]区间内: 利用独热编码,为离散变量的每个状态创建一个二进制表示。
5.根据权利要求3所述的基于TBM运行数据的不良地质条件识别与预测方法,其特征在于:其中,步骤2-3的具体过程为:步骤2-3-1,将TBM掘进循环分为掘进段和停机段组成,将所述掘进段按照数据整体趋势分为上升段和稳定段;步骤2-3-2,定义G(X)=g(推力)g(扭矩)g(掘进速度),当G(X)=0时,认为掘进处于所述停机段,从数据集中删除对应数据行;步骤2-3-3,使用累积和变点识别法识别上升段与稳定段分界点:S kj 达到最大值时对应的x ij 即为所述上升段与所述稳定段的分界点;步骤2-3-4,取各个变量在稳定段内的均值构成TBM运行参数数据集D。