1.一种基于多模态大模型的机器人控制方法,其特征在于,包括:实时采集目标作业任务所处场景的多源模态数据,并基于所述多源模态数据的类型,采用对应的机器学习模型对所述多源模态数据进行特征提取,得到多模态特征;对所述多模态特征进行位置编码及Transformer融合处理,得到多模态融合特征;将构建的作业任务知识库与所述多模态融合特征输入至大语言模型,得到对所述目标作业任务的分解结果,并引入人在回路机制对所述分解结果进行优化,得到子任务序列;基于所述子任务序列中的子任务类型,将所述子任务序列及所述多源模态数据输入至视觉语言动作模型或强化学习模型中进行处理,生成所述子任务序列对应的运动指令,以使机器人启动所述目标作业任务的执行进程。
2.根据权利要求1所述的一种基于多模态大模型的机器人控制方法,其特征在于,所述多源模态数据包括力觉与点云数据、图像数据以及音频数据;其中,所述采用对应的机器学习模型对所述多源模态数据进行特征提取,得到多模态特征,包括:将所述力觉与点云数据输入至长短期记忆网络模型中进行处理,以捕捉力交互模式,得到时序动态特征;将所述图像数据输入至改进ResNet-50模型中进行处理,得到包含目标物体的局部特征;将所述音频数据输入至Whisper-Base模型和BERT-Base-Chinese模型中进行处理,得到用于解析执行指令的语音特征;将所述时序动态特征、所述局部特征和所述语音特征组合,得到所述多模态特征。
3.根据权利要求1所述的一种基于多模态大模型的机器人控制方法,其特征在于,所述对所述多模态特征进行位置编码及Transformer融合处理,得到多模态融合特征,包括:通过位置编码将时间步嵌入所述多模态特征中,得到多模态编码特征;将所述多模态编码特征输入至Transformer编码器中,以通过自注意力机制和多头注意力机制进行特征融合,得到所述多模态融合特征。
4.根据权利要求1所述的一种基于多模态大模型的机器人控制方法,其特征在于,所述将构建的作业任务知识库与所述多模态融合特征输入至大语言模型,得到对所述目标作业任务的分解结果,并引入人在回路机制对所述分解结果进行优化,得到子任务序列,包括:获取带电作业规范数据和带电作业专家数据,并从中提取作业动作静态关联信息和作业环境依赖规则信息,以构建所述作业任务知识库;将所述目标作业任务转化为自然语言,并与所述多模态融合特征输入至基于Transformer架构的预训练大语言模型中,以结合所述作业任务知识库对所述目标作业任务进行分解,得到初始子任务序列;根据所述作业任务知识库对所述初始子任务序列进行排序,并对排序后的初始子任务序列进行参数化处理,生成一次优化子任务序列;基于所述机器人的物理运动范围,并结合所述作业任务知识库对所述一次优化子任务序列进行优化,得到二次优化子任务序列;接收外部指令,以引入所述人在回路机制对所述二次优化子任务序列进行再优化,得到最终的所述子任务序列。
5.根据权利要求4所述的一种基于多模态大模型的机器人控制方法,其特征在于,所述将所述目标作业任务转化为自然语言,并与所述多模态融合特征输入至基于Transformer架构的预训练大语言模型中,以结合所述作业任务知识库对所述目标作业任务进行分解,得到初始子任务序列,包括:对所述目标作业任务进行解析,得到结构化自然语言任务以与所述多模态融合特征通过特征对齐嵌入法进行处理,并在处理结果中嵌入时序位置编码,得到含时序信息的跨模态融合特征向量;基于所述跨模态融合特征向量和所述结构化自然语言任务,从所述作业任务知识库中匹配知识,得到与所述目标作业任务相匹配的静态知识;将所述跨模态融合特征向量、所述结构化自然语言任务和所述静态知识输入至所述基于Transformer架构的预训练大语言模型中进行动态模板匹配和链式推理,以在第一路径通过模板自适应机制对所述目标作业任务进行分解,生成初步子任务框架,并在第二路径通过约束引导式思维链对所述目标作业任务进行分解,生成子任务逻辑链;对所述初步子任务框架和所述子任务逻辑链进行冲突检测和可行性校验,并在冲突检测通过且可行性校验通过后,根据所述初步子任务框架和所述子任务逻辑链,生成所述初始子任务序列。
6.根据权利要求4所述的一种基于多模态大模型的机器人控制方法,其特征在于,所述接收外部指令,以引入所述人在回路机制对所述二次优化子任务序列进行再优化,得到最终的所述子任务序列,包括:接收外部指令,并对所述外部指令进行标准化处理,得到包含类型、内容和时间戳的标准化指令三元组;基于双阈值校验规则约束,将所述标准化指令三元组输入至基于数字孪生技术构建的作业预演模型中进行模拟,以生成有效指令队列,并对所述有效指令队列的类型进行判断;在所述有效指令队列为优先级干预指令时,通过大语言模型分析所述二次优化子任务序列中所含子任务间的逻辑关系,并将所述有效指令队列对应的目标子任务的执行位置进行调整,得到第一子任务序列;在所述有效指令队列为任务替换指令时,基于所述有效指令队列对应的目标子任务生成断点标记,并根据所述断点标记调用所述视觉语言动作模型生成新任务,以对所述二次优化子任务序列进行调整,得到第二子任务序列;在所述有效指令队列为参数修正指令时,对所述有效指令队列进行参数边界校验,并在校验通过后将所述有效指令队列转化为控制信号,以对所述二次优化子任务序列进行修正,得到第三子任务序列。
7.根据权利要求1所述的一种基于多模态大模型的机器人控制方法,其特征在于,所述视觉语言动作模型包括视觉网络层、语言网络层和流匹配动作网络层;所述多源模态数据还包括实时传感器数据;其中,所述基于所述子任务序列中的子任务类型,将所述子任务序列及所述多源模态数据输入至视觉语言动作模型或强化学习模型中进行处理,生成所述子任务序列对应的运动指令,以使机器人启动所述目标作业任务的执行进程,包括:对所述子任务序列中的子任务类型进行判断,若判定所述子任务序列中的某一子任务为第一类型,则将所述多源模态数据输入至所述强化学习模型中进行处理,生成第一类型子任务对应的分运动指令;若判定所述子任务序列中的某一子任务为第二类型,则将所述多模态融合特征和第二类型子任务输入至所述视觉语言动作模型中,以使所述视觉网络层对所述多模态融合特征进行识别,得到第二类型子任务对应的目标视觉特征,以使所述语言网络层结合所述作业任务知识库对第二类型子任务进行解析,得到有序子任务序列,以使所述流匹配动作网络层对所述目标视觉特征、所述有序子任务序列和所述实时传感器数据进行处理,生成第二类型子任务对应的分运动指令;将各所述分运动指令进行整合,得到所述子任务序列对应的运动指令,以使机器人启动所述目标作业任务的执行进程。
8.一种基于多模态大模型的机器人控制系统,其特征在于,包括:特征提取模块,用于实时采集目标作业任务所处场景的多源模态数据,并基于所述多源模态数据的类型,采用对应的机器学习模型对所述多源模态数据进行特征提取,得到多模态特征;特征融合模块,用于对所述多模态特征进行位置编码及Transformer融合处理,得到多模态融合特征;任务分解模块,用于将构建的作业任务知识库与所述多模态融合特征输入至大语言模型,得到对所述目标作业任务的分解结果,并引入人在回路机制对所述分解结果进行优化,得到子任务序列;指令执行模块,用于基于所述子任务序列中的子任务类型,将所述子任务序列及所述多源模态数据输入至视觉语言动作模型或强化学习模型中进行处理,生成所述子任务序列对应的运动指令,以使机器人启动所述目标作业任务的执行进程。
9.一种电子设备,其特征在于,包括处理器、存储器以及存储在所述存储器中且被配置为由所述处理器执行的计算机程序,所述处理器执行所述计算机程序时实现如权利要求1至7中任意一项所述的基于多模态大模型的机器人控制方法。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质包括存储的计算机程序,其中,所述计算机可读存储介质所在设备执行所述计算机程序时,实现如权利要求1至7中任意一项所述的基于多模态大模型的机器人控制方法。