有效
一种基于改进Stacking的强化采油技术智能筛选决策模型的构建方法
张娜、张敏、霍龙、蒲景阳、王海柱、罗嗣慧、东野升富、张争
北京石油化工学院
摘要
本发明属于油气田智能开发研究技术领域,具体涉及一种基于改进Stacking的强化采油技术智能筛选决策模型的构建方法,具体包括如下步骤:步骤1、收集全球已成功实施强化采油项目数据,通过数据处理与分析形成完整数据集;步骤2、选用多种常规机器学习算法,构建多种基于常规机器学习算法的强化采油技术智能筛选模型;步骤3、利用Stacking集成学习进行融合构建基于Stacking的强化采油技术智能筛选模型;步骤4、通过新增元模型对Stacking进行改进,构建基于改进Stacking的强化采油技术智能筛选集成模型。本发明解决了机器学习算法在强化采油技术筛选决策的局限性,为油藏工程师提供更准确的决策支持。
1.一种基于改进Stacking的强化采油技术智能筛选决策模型的构建方法,其特征在于,包括如下步骤:步骤1、收集全球已成功实施强化采油项目数据,选择合适的储层岩石及流体特征作为特征参数,通过数据处理与分析形成完整数据集;步骤2、选用多种常规机器学习算法,以步骤1得到的完整数据集中的特征参数作为输入、完整数据集中的强化采油技术为输出,构建多种基于常规机器学习算法的强化采油技术智能筛选模型;步骤3、基于步骤2构建的多种基于常规机器学习算法的强化采油技术智能筛选模型的预测性能,利用Stacking集成学习进行融合构建基于Stacking的强化采油技术智能筛选模型;步骤4、基于步骤3构建的基于Stacking的强化采油技术智能筛选模型的预测性能,通过新增元模型对Stacking进行改进,构建基于改进Stacking的强化采油技术智能筛选集成模型;其中,步骤3具体为:步骤3.1、利用Stacking集成学习方法,通过使用元模型将多个不同的基模型的预测结果进行集成,具体为:步骤3.1.1、数据集划分:将步骤1.4所划分的训练集作为训练数据,使用K折交叉验证划分K个子集,其中K-1个子集为子训练集,剩余一个子集作为子验证集;步骤3.1.2、基模型训练:使用不同的基模型在子训练集上进行独立训练;步骤3.1.3、生成新特征:将所有基模型在子验证集上的预测结果作为新的特征,组合成一个新的训练数据集,将基模型在步骤1.4所划分的测试集上的预测结果组成新的测试数据集;步骤3.1.4、训练元模型:将基模型的预测结果作为新的特征输入到一个元模型中,通过拟合基模型的预测结果,以最大化整体模型的准确性,得到基于Stacking的强化采油技术智能筛选模型;其中,基模型和元模型从步骤2构建的多种基于常规机器学习算法的强化采油技术智能筛选模型中选取,所述基模型的选取标准为:根据基于常规机器学习算法的强化采油技术智能筛选模型的预测性能,选取能够给元模型提供正确的特征信息,且在预测同一目标时能够捕捉数据的不同方面的不同模型作为基模型;所述元模型的选取标准为:根据基于常规机器学习算法的强化采油技术智能筛选模型的预测性能,选取结构简单且具备抗过拟合特性的模型作为元模型;步骤3.2、通过准确率、精确度、召回率、F1分数、混淆矩阵、Kappa系数及MCC值对基于Stacking的强化采油技术智能筛选模型进行评估,并利用学习曲线对基于Stacking的强化采油技术智能筛选模型的运行过程进行分析。
2.根据权利要求1所述的构建方法,其特征在于,步骤1包括如下子步骤:步骤1.1、对全球已成功实施强化采油项目数据进行统计,选择能有效反映油藏的真实储层和流体状况,且与强化采油技术驱油过程紧密相关的储层岩石及流体特性作为特征参数;步骤1.2、以《石油与天然气杂志》半年一次的强化采油项目调查结果为数据来源,通过全球其它记载有相关数据的文件对数据进行补充,形成原始数据集;步骤1.3、对所述原始数据集中的数据进行预处理,包括删除重复数据、利用特征均值替换缺失值及对离散型参数进行One-Hot编码,形成完整数据集,并对所述数据集中的连续型特征参数进行对数化处理;步骤1.4、采用留出法将步骤1.3得到的完整数据集随机按照8:1:1的比例划分训练集、验证集及测试集。
3.根据权利要求1或2所述的构建方法,其特征在于,所述特征参数包括:岩性、孔隙度、渗透率、油藏深度、原油比重、原油温度、原油黏度、净厚度和初始含油饱和度。
4.根据权利要求2所述的构建方法,其特征在于,步骤2中,所述常规机器学习算法包括随机森林算法、极限梯度提升算法、神经网络算法、决策树算法、支持向量机算法和逻辑回归算法。
5.根据权利要求4所述的构建方法,其特征在于,步骤2具体为:步骤2.1、确定评价指标:选用准确率、精确度、召回率、F1分数作为常规评价指标用于评估模型整体性能,引用混淆矩阵、Kappa系数及MCC值用于评估模型克服类别不平衡问题的能力;步骤2.2、确定超参数优化方法:选择随机搜索和网格搜索相结合的方式进行模型优化;步骤2.3、采用多种常规机器学习算法对步骤1得到的完整数据集进行学习,利用步骤2.2的超参数优化方法进行优化,构建多种基于常规机器学习算法的强化采油技术智能筛选模型;步骤2.4、选用步骤2.1确定的评价指标对步骤2.3构建的基于常规机器学习算法的强化采油技术智能筛选模型的预测性能进行评估。
6.根据权利要求5所述的构建方法,其特征在于,步骤2.3具体为:(1)构建基于随机森林算法的强化采油技术智能筛选模型:Step1:通过自助采样,随机形成多个子数据集,用于独立训练单棵决策树;Step2:从特征空间内随机选择多个特征形成特征子集,在构建决策树的每个节点时,从特征子集中选择最优特征进行分裂;Step3:重复上述步骤,生成多棵决策树,形成随机森林;(2)构建基于极限梯度提升算法的强化采油技术智能筛选模型:Step1:初始化一个常数模型作为初始预测值;Step2:迭代构建多个决策树,在每次迭代中,确定一个能够最小化目标函数的决策树;Step3:每构建一个决策树后,将其预测结果加到之前的预测值上,以得到新的预测值;Step4:持续进行迭代过程,直到达到预设迭代次数或目标函数的变化量小于某个阈值为止;(3)构建基于神经网络算法的强化采油技术智能筛选模型:Step1:前向传播,从输入层到输出层计算网络的输出;Step2:计算损失,根据预测结果和真实标签计算损失函数;Step3:反向传播,从输出层向输入层计算梯度,并更新权重和偏置;Step4:迭代训练,重复上述过程,直到网络收敛;(4)构建基于决策树算法的强化采油技术智能筛选模型:Step1:从根节点开始,选择能够最大程度地减少数据集不纯度的特征作为分裂特征;Step2:根据选择的特征,将数据集划分为多个子集;Step3:对于划分后的子集,重复上述过程,递归构建决策树分支,直到满足停止条件为止;(5)构建基于支持向量机算法的强化采油技术智能筛选模型:支持向量机算法获得分类结果的计算公式为:公式(12)中,f(x)表示对于输入数据x的分类结果,x表示待分类的输入数据,i表示样本编号,取值为1,2,…,n,n为样本数量,α i 是拉格朗日乘子,y i 是第i个样本的标签,K(x,x i )是核函数,x i 表示第i个样本的特征向量,b是偏置项,当f(x)>0时,样本x属于正类别;当f(x)<0,样本x属于负类别;(6)构建基于逻辑回归算法的强化采油技术智能筛选模型:逻辑回归算法获得分类结果的计算公式为:z=w T x 1 +b(13)公式(13)中,z表示基于输入x 1 给出的输出值,w T 表示权重向量的转置,x 1 表示特征向量,包含输入数据的各个特征值,b是偏置项;公式(14)中,σ(z)为类别概率,当σ(z)≥0.5,样本分类为正样本;当σ(z)<0.5,样本分类为负样本。
7.根据权利要求1所述的构建方法,其特征在于,步骤4具体为:步骤4.1、依据步骤3.2中基于Stacking的强化采油技术智能筛选模型的预测性能,从步骤2构建的基于常规机器学习算法的强化采油技术智能筛选模型中选择合适的模型作为新增元模型,在步骤3.1构建的基于Stacking的强化采油技术智能筛选模型的基础上提出一种基于改进Stacking的强化采油技术智能筛选决策模型,具体为:步骤4.1.1、数据集划分:将步骤1.4所划分的训练集作为训练数据,使用K折交叉验证划分K个子集,其中K-1个子集为子训练集,剩余一个子集作为子验证集;步骤4.1.2、基模型训练:使用不同的基模型在子训练集上进行独立训练;步骤4.1.3、生成新特征:将所有基模型在子验证集上的预测结果作为新的特征,组合成一个新的训练数据集,将基模型在步骤1.4所划分的测试集上的预测结果组成新的测试数据集,作为测试集新特征;步骤4.1.4、训练元模型:将基模型的预测结果作为新的特征输入到初始元模型中,通过拟合基模型的预测结果,以最大化整体模型的准确性;步骤4.1.5、训练新元模型:利用初始元模型在新训练数据集上的预测结果对新增元模型进行训练,得到基于改进Stacking的强化采油技术智能筛选决策模型。
8.根据权利要求7所述的构建方法,其特征在于,步骤4.1中,所述基模型为步骤3中选用的基模型,所述初始元模型为步骤3中选用的元模型,所述新增元模型选取标准为:根据基于常规机器学习算法的强化采油技术智能筛选模型的预测性能,选取结构简单且具备抗过拟合特性的模型作为新增元模型。



