1.一种基于强化学习的采空区三带注浆动态调控方法,其特征在于:包括如下步骤:使用深度学习算法,构建多源监测数据分析模型,使用强化学习算法,构建注浆动态调控模型,并使用数字孪生技术,构建采空区三带数字孪生模型;所述的多源监测数据分析模型基于3D-DBN-CNN-LSTM- ST-CNN算法构建,且多源监测数据分析模型包括基于3D-DBN算法构建的三维空间特征提取模块、基于CNN算法构建的非结构化数据特征提取模块、基于LSTM构建的结构化数据特征提取模块以及基于ST-CNN算法构建的多源监测数据分析模块,所述的三维空间特征提取模块、非结构化数据特征提取模块以及结构化数据特征提取模块均与多源监测数据分析模块连接;所述的注浆动态调控模型基于MPO-MOGRPO-ICPO算法构建,且注浆动态调控模型包括依次连接的基于MPO算法构建的元策略优化模块、基于MOGRPO算法构建的调控策略生成模块以及基于ICPO算法构建的调控策略优化模块,所述的调控策略生成模块包括目标函数集合、经验回放池、Actor网络以及智能体,且智能体分别与目标函数集合、经验回放池以及Actor网络连接,所述的Actor网络与调控策略优化模块连接;基于采空区三带数字孪生模型,采集采空区三带的实时多源监测数据,并对实时多源监测数据进行时空关联,得到时空关联后实时多源监测数据;根据时空关联后实时多源监测数据,使用多源监测数据分析模型,进行数据分析,得到实时多源监测数据分析结果,包括如下步骤:使用多源监测数据分析模型的三维空间特征提取模块,提取采空区三带数字孪生模型中采空区三带三维仿真模型的实时三维空间特征;使用多源监测数据分析模型的非结构化数据特征提取模块,提取时空关联后实时多源监测数据的实时非结构化数据特征;使用多源监测数据分析模型的结构化数据特征提取模块,提取时空关联后实时多源监测数据的实时结构化数据特征;根据实时三维空间特征、实时非结构化数据特征以及实时结构化数据特征,使用多源监测数据分析模型的多源监测数据分析模块,进行数据分析,得到实时多源监测数据分析结果;根据实时多源监测数据分析结果,使用注浆动态调控模型,进行注浆动态调控策略生成,得到实时注浆动态调控策略,包括如下步骤:根据实时多源监测数据分析结果,使用注浆动态调控模型的元策略优化模块,对注浆动态调控模型的调控策略生成模块的Actor网络进行调整,得到调整后Actor网络;在注浆动态调控模型的目标函数集合中选择实时目标函数,并基于实时目标函数,在注浆动态调控模型的经验回放池中随机抽取若干历史注浆动态调控经验;根据实时多源监测数据分析结果,调整智能体的状态空间,得到调整后状态空间,根据若干历史注浆动态调控经验,调整智能体的动作空间,得到调整后动作空间;基于实时目标函数、调整后状态空间以及调整后动作空间,使用调控策略生成模块的智能体,控制调整后Actor网络,生成实时注浆动态调控动作概率分布;使用注浆动态调控模型的调控策略优化模块,对实时注浆动态调控动作概率分布进行优化,得到实时注浆动态调控策略;使用采空区三带数字孪生模型,对实时多源监测数据分析结果和实时注浆动态调控策略进行可视化,执行实时注浆动态调控策略,并继续数据采集步骤。
2.根据权利要求1所述的一种基于强化学习的采空区三带注浆动态调控方法,其特征在于:使用深度学习算法,构建多源监测数据分析模型,使用强化学习算法,构建注浆动态调控模型,并使用数字孪生技术,构建采空区三带数字孪生模型,包括如下步骤:使用深度学习算法,构建初始的多源监测数据分析模型,使用强化学习算法,构建初始的注浆动态调控模型;构建采空区三带三维仿真模型,并结合初始的多源监测数据分析模型和初始的注浆动态调控模型,使用数字孪生技术,构建采空区三带数字孪生模型;采集数字世界的采空区三带数字孪生模型对应的物理世界的采空区三带的若干历史多源监测数据,并进行预处理,得到若干预处理后历史多源监测数据;根据采空区三带三维仿真模型和若干预处理后历史多源监测数据,对采空区三带数字孪生模型的初始的多源监测数据分析模型和初始的注浆动态调控模型进行训练,得到最终的多源监测数据分析模型和最终的注浆动态调控模型。
3.根据权利要求2所述的一种基于强化学习的采空区三带注浆动态调控方法,其特征在于:使用深度学习算法,构建初始的多源监测数据分析模型,使用强化学习算法,构建初始的注浆动态调控模型,包括如下步骤:使用3D-DBN-CNN-LSTM-ST-CNN算法,构建初始的多源监测数据分析模型;使用MPO-MOGRPO-ICPO算法,构建初始的注浆动态调控模型;所述的初始的注浆动态调控模型包括初始的元策略优化模块、初始的调控策略生成模块以及初始的调控策略优化模块;为初始的调控策略生成模块设置目标函数集合、经验回放池、Actor网络以及智能体,并将Actor网络的初始网络参数作为初始的元策略优化模块的输出参数;以注浆动态调控策略生成问题作为初始的调控策略生成模块的模拟环境,并为初始的调控策略生成模块的智能体设置动作空间和状态空间;以最小化策略生成误差为优化目标,定义初始的调控策略优化模块的适应度函数,并将初始的调控策略生成模块的Actor网络的输出量作为初始的调控策略优化模块的输入量。
4.根据权利要求3所述的一种基于强化学习的采空区三带注浆动态调控方法,其特征在于:根据采空区三带三维仿真模型和若干预处理后历史多源监测数据,对采空区三带数字孪生模型的初始的多源监测数据分析模型和初始的注浆动态调控模型进行训练,得到最终的多源监测数据分析模型和最终的注浆动态调控模型,包括如下步骤:将采空区三带三维仿真模型与若干预处理后历史多源监测数据进行组合,并按照7:3的比例划分为模型训练集和模型测试集;根据模型训练集,对采空区三带数字孪生模型的初始的多源监测数据分析模型进行训练,得到优化的多源监测数据分析模型,并生成若干历史多源监测数据分析结果;根据模型测试集,对优化的多源监测数据分析模型进行测试,若测试准确率大于准确率阈值,则输出最终的多源监测数据分析模型,否则,继续进行训练;遍历目标函数集合中的所有目标函数,根据若干历史多源监测数据分析结果,对初始的注浆动态调控模型进行训练,得到最终的注浆动态调控模型,并将训练过程中生成的历史注浆动态调控经验存储至经验回放池中。
5.根据权利要求4所述的一种基于强化学习的采空区三带注浆动态调控方法,其特征在于:所述的历史多源监测数据包括采空区三带的历史地层监测数据、历史环境监测数据以及历史设备运行监测数据;所述的实时多源监测数据包括采空区三带的实时地层监测数据、实时环境监测数据以及实时设备运行监测数据。
6.根据权利要求5所述的一种基于强化学习的采空区三带注浆动态调控方法,其特征在于:基于采空区三带数字孪生模型,采集采空区三带的实时多源监测数据,并对实时多源监测数据进行时空关联,得到时空关联后实时多源监测数据,包括如下步骤:采集物理世界的采空区三带的实时多源监测数据,进行预处理,并将得到的预处理后实时多源监测数据输入采空区三带数字孪生模型;将预处理后实时多源监测数据在时间戳上进行对齐,得到时间对齐后实时多源监测数据;对时间对齐后实时多源监测数据进行空间配准,得到空间配准后实时多源监测数据;提取空间配准后实时多源监测数据的实时时间特征和实时空间特征,并对实时时间特征和实时空间特征进行特征融合,得到实时融合时空特征;对实时融合时空特征在采空区三带数字孪生模型中进行时空关联,得到时空关联后实时多源监测数据。
7.一种基于强化学习的采空区三带注浆动态调控系统,用于实现如权利要求1-6任一所述的采空区三带注浆动态调控方法,其特征在于:包括依次连接的模型构建单元、时空关联单元、数据分析单元、调控策略生成单元以及可视化单元。