1.一种钻井辅助决策方法,其特征在于,包括:获取第一实时作业数据,其中,所述第一实时作业数据包括钻井设备的第一实时工作参数以及第一实时钻井数据;将所述第一实时作业数据输入至初始决策模型,得到初始决策,其中,所述初始决策模型基于行为克隆得到;获取钻井设备的第二实时作业数据,其中,所述第二实时作业数据是在司钻基于所述初始决策确定实际操作,并将所述实际操作应用于所述钻井设备后得到的;根据所述第二实时作业数据,确定第一意图标签,其中,所述第一意图标签用于表征所述实际操作的工程目标;基于强化学习,将所述第二实时作业数据和所述第一意图标签输入至决策优化模型,得到优化决策;所述初始决策模型的训练过程包括:获取历史作业数据以及对应的历史决策信息,其中,所述历史作业数据包括所述钻井设备的历史工作参数以及历史钻井数据;根据所述历史钻井数据,确定第二意图标签,其中,所述第二意图标签用于表征所述历史决策信息的动机;将所述历史作业数据、对应的所述历史决策信息以及所述第二意图标签输入至预设神经网络,得到所述历史作业数据对应的预测决策信息;根据所述历史决策信息及所述预测决策信息,基于第一损失函数,计算所述历史作业数据对应的损失值;以最小化所述损失值为目标,迭代训练所述预设神经网络,直到满足预设第一训练终止条件时,终止训练以得到所述初始决策模型。
2.根据权利要求1所述的方法,其特征在于,所述预测决策信息包括司钻是否做出决策、所述决策对应的需调整的工作参数类型以及每个所述工作参数类型的调整值。
3.根据权利要求1所述的方法,其特征在于,所述第一损失函数由决策发生判断损失、决策类型损失以及决策参数调整值损失加权求和得到,其中,所述决策发生判断损失为交叉熵损失函数,所述决策类型损失为多标签交叉熵损失函数,所述决策参数调整值损失为均方误差损失函数。
4.根据权利要求1所述的方法,其特征在于,还包括,所述历史决策信息包括钻井设备移动预设距离内的多个历史决策。
5.根据权利要求1所述的方法,其特征在于,所述基于强化学习,将所述第二实时作业数据和所述第一意图标签输入至决策优化模型,得到优化决策,包括:根据所述第二实时作业数据作为状态空间,并以所述第一意图标签作为所述状态空间的状态增强,输入至所述决策优化模型,从动作空间中确定目标动作,其中,所述动作空间包括目标工作参数的变化状态;根据所述动作空间与所述第一意图标签,通过奖励函数与第二损失函数,确定期望总奖励;以最大化所述期望总奖励为目标,确定所述优化决策。
6.根据权利要求5所述的方法,其特征在于,所述奖励函数根据所述初始决策与所述实际操作的一致性奖励以及所述实际操作与所述第一意图标签的一致性奖励进行加权求和得到。
7.根据权利要求5所述的方法,其特征在于,所述第二损失函数包括:其中, L RL 为所述第二损失函数,Q表示在某一状态下采取某一行动所能获得的期望总奖励, 表示计算所有状态s和动作a下Q值的差异的期望,R是当前状态下采取某个行动所获得的实际奖励,γ是折扣因子,maxa’Q(s’,a’)是在下一状态s’中智能体采取的最大Q值,Q(s,a)是智能体在状态s下采取行动a的Q值。
8.一种钻井辅助决策装置,其特征在于,包括:存储器,被配置成存储指令;以及处理器,被配置成从所述存储器调用所述指令以及在执行所述指令时能够实现根据权利要求1至7中任一项所述的钻井辅助决策的方法。
9.一种机器可读存储介质,其特征在于,该机器可读存储介质上存储有指令,该指令用于使得机器执行根据权利要求1至7中任一项所述的钻井辅助决策的方法。