1.一种推理模型训练方法,其特征在于,包括:获取第一训练数据和第二训练数据,所述第一训练数据包括多步推理作答的问题,所述第二训练数据包括单步计算或单一推理逻辑作答的问题;对所述第二训练数据中的问题进行文本改写,确定改写后的第三训练数据;基于所述第一训练数据、所述第二训练数据和所述第三训练数据,对推理模型进行监督微调,确定第一推理模型;基于所述第一推理模型,对第四训练数据进行复杂度标定,确定所述第四训练数据的复杂度标签,所述第四训练数据用于构建强化学习训练的状态空间与奖励基准;对所述复杂度标签与推理模式进行匹配,确定奖励机制,所述推理模式包括生成中间推理链或直接作答;以及,基于所述奖励机制和所述第四训练数据,对所述第一推理模型进行强化学习训练,确定第二推理模型。
2.如权利要求1所述的推理模型训练方法,其特征在于,基于所述第一推理模型,对第四训练数据进行复杂度标定,确定所述第四训练数据的复杂度标签,包括:基于直接作答的推理模式,所述第一推理模型重复生成第四训练数据对应的答案;基于所述答案和重复生成所述答案的次数,确定所述第四训练数据的平均准确率;当所述平均准确率大于或等于阈值,确定所述第四训练数据的复杂度标签为简单,当所述平均准确率小于所述阈值,确定所述第四训练数据的复杂度标签为复杂。
3.如权利要求2所述的推理模型训练方法,其特征在于,对所述复杂度标签与推理模式进行匹配,确定奖励机制,包括:对所述复杂度标签与推理模式进行匹配,确定基础奖励和额外奖励;基于所述基础奖励和所述额外奖励,确定奖励机制。
4.如权利要求3所述的推理模型训练方法,其特征在于,对所述复杂度标签与推理模式进行匹配,确定基础奖励和额外奖励,包括:基于生成中间推理链的推理模式,当前模型对所述复杂度标签为复杂的第四训练数据进行作答时,确定额外奖励,所述当前模型为处于强化学习训练过程的中间模型;基于生成中间推理链或直接作答的推理模式,所述当前模型对所述第四训练数据进行推理,确定基础奖励,所述基础奖励基于推理答案的正确性确定。
5.如权利要求1所述的推理模型训练方法,其特征在于,对所述第二训练数据中的问题进行文本改写,确定改写后的第三训练数据,包括:通过添加无关背景描述、使用迂回表达和/或引入迷惑性细节描述,对所述第二训练数据中的问题进行文本改写,确定冗余训练数据;对所述第二训练数据中的问题进行语义特征提取,确定提取后的精炼训练数据;基于所述冗余训练数据和所述精炼训练数据,确定第三训练数据。
6.如权利要求1所述的推理模型训练方法,其特征在于,基于所述第一训练数据、所述第二训练数据和所述第三训练数据,对推理模型进行监督微调,确定第一推理模型,包括:对所述第一训练数据、所述第二训练数据和所述第三训练数据进行标准化处理,确定标准化处理后的混合训练数据集;基于所述混合训练数据集,通过交叉熵损失函数对推理模型进行监督微调,确定第一推理模型。
7.如权利要求1所述的推理模型训练方法,其特征在于,基于所述奖励机制和所述第四训练数据,对所述第一推理模型进行强化学习训练,确定第二推理模型,包括:基于所述奖励机制和所述第四训练数据,通过对目标函数进行最大化求解,迭代更新所述第一推理模型的参数,确定第二推理模型,所述目标函数包括优势函数和KL散度惩罚项。
8.一种电子设备,其特征在于,包括:存储器,所述存储器存储执行指令;以及,处理器,所述处理器执行所述存储器存储的执行指令,使得所述处理器执行权利要求1至7中任一项所述的推理模型训练方法。
9.一种可读存储介质,其特征在于,所述可读存储介质中存储有执行指令,所述执行指令被处理器执行时用于实现权利要求1至7中任一项所述的推理模型训练方法。
10.一种计算机程序产品,包括计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至7中任一项所述的推理模型训练方法。