1.一种大模型适配方法,其特征在于,包括:基于历史主网操作指令数据,对预训练大模型进行参数微调,得到微调主网大模型;采用所述微调主网大模型执行主网操作任务,得到微调主网大模型的输出结果和基于所述输出结果的反馈数据;基于所述输出结果和所述反馈数据,对所述微调主网大模型进行强化学习,得到主网操作任务大模型;基于历史主网操作指令数据,对预训练大模型进行参数微调,得到微调主网大模型,包括:将历史主网操作指令数据进行预处理,得到指令文本序列;将所述指令文本序列输入至所述预训练大模型,得到所述预训练大模型的输出结果;基于所述输出结果和所述指令文本序列关联实际任务的偏差,以及所述输出结果的电网操作安全度,形成损失函数;基于所述损失函数,对所述预训练大模型进行参数微调,得到微调主网大模型;所述损失函数具体如下: ;其中, 是预训练大模型的输出结果与指令文本序列关联实际任务的偏差, 是预训练大模型的输出结果的电网操作安全度惩罚项, 和 是权重系数;基于所述输出结果和所述反馈数据,对所述微调主网大模型进行强化学习,得到主网操作任务大模型,包括:将所述输出结果作为行动,并基于所述反馈数据和奖励函数确定任务奖励;所述奖励函数包括任务完成奖励和任务执行安全度奖励;基于所述行动和任务奖励,对所述微调主网大模型进行强化学习,得到主网操作任务大模型;所述奖励函数具体如下: ;其中, 是微调主网大模型的任务完成奖励, 是任务执行安全度奖励, 是权重因子。
2.根据权利要求1所述的方法,其特征在于,基于损失函数,对预训练大模型进行参数微调,得到微调主网大模型,包括:对所述预训练大模型中从输出层开始的设定层数的模型参数进行冻结;基于所述损失函数,对所述预训练大模型中除冻结的模型参数之外的其他模型参数进行微调,得到微调主网大模型。
3.根据权利要求1所述的方法,其特征在于,在对预训练大模型进行参数微调,得到微调主网大模型之后,还包括:将验证主网操作指令数据输入至所述微调主网大模型,得到微调主网大模型的输出结果,并根据所述输出结果确定所述微调主网大模型的参数指标;在所述参数指标不满足训练需求的情况下,返回执行基于历史主网操作指令数据,对预训练大模型进行参数微调,得到微调主网大模型的操作直至所述参数指标满足训练需求。
4.一种大模型适配装置,其特征在于,包括:参数微调模块,用于基于历史主网操作指令数据,对预训练大模型进行参数微调,得到微调主网大模型;反馈获取模块,用于采用所述微调主网大模型执行主网操作任务,得到微调主网大模型的输出结果和基于所述输出结果的反馈数据;强化学习模块,用于基于所述输出结果和所述反馈数据,对所述微调主网大模型进行强化学习,得到主网操作任务大模型;参数微调模块,包括:数据预处理单元,用于将历史主网操作指令数据进行预处理,得到指令文本序列;模型输出结果获取单元,用于将所述指令文本序列输入至所述预训练大模型,得到所述预训练大模型的输出结果;损失函数构建单元,用于基于所述输出结果和所述指令文本序列关联实际任务的偏差,以及所述输出结果的电网操作安全度,形成损失函数;参数微调单元,用于基于所述损失函数,对所述预训练大模型进行参数微调,得到微调主网大模型;所述损失函数具体如下: ;其中, 是预训练大模型的输出结果与指令文本序列关联实际任务的偏差, 是预训练大模型的输出结果的电网操作安全度惩罚项, 和 是权重系数;强化学习模块,具体用于:将所述输出结果作为行动,并基于所述反馈数据和奖励函数确定任务奖励;所述奖励函数包括任务完成奖励和任务执行安全度奖励;基于所述行动和任务奖励,对所述微调主网大模型进行强化学习,得到主网操作任务大模型;所述奖励函数具体如下: ;其中, 是微调主网大模型的任务完成奖励, 是任务执行安全度奖励, 是权重因子。
5.一种电子设备,其特征在于,所述电子设备包括:至少一个处理器;以及与所述至少一个处理器通信连接的存储器;其中,所述存储器存储有可被所述至少一个处理器执行的计算机程序,所述计算机程序被所述至少一个处理器执行,以使所述至少一个处理器能够执行权利要求1-3中任一项所述的大模型适配方法。
6.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机指令,所述计算机指令用于使处理器执行时实现权利要求1-3中任一项所述的大模型适配方法。