1.一种基于动态数据选择的强化学习模型训练方法,其特征在于,包括:S1:依据预设的数据质量、多样性及难度评估指标,从原始数学问题数据池中筛选,得到候选训练集;S2:针对所述候选训练集中的每个训练样本,计算其数据有效性分数;S3:对所述候选训练集进行难度过滤,构建自适应训练课程;S4:根据候选训练集的解答推理过程和奖励分数进一步过滤候选训练集;S5:基于进一步过滤出的候选训练集和数据有效性分数,通过设置随训练进程衰减的温度参数和概率阈值,为当前训练周期动态挑选数据子集;S6:将挑选的数据子集投入强化学习模型训练,根据正确性奖励和格式奖励优化训练强化学习模型;所述数据有效性分数是对问题难度系数、解题思维链长度以及奖励适应度的加权组合,其形式化表达为: ;其中, 为数据有效性分数, 为候选训练样本, , , 分别是该样本的难度系数、思维链复杂度和奖励适应性的量化分值; 是对应三个组件的权重系数;所述加权组合的权重系数通过Softmax参数化方法进行动态调整,以根据模型训练状态自适应地控制各评估组件的相对重要性,其具体计算公式如下: ;式中, 是与三个组件 相对应的实值参数; ;其中, 代表当前样本的静态难度分值, 代表整个候选数据集中所有样本的平均难度分值, 代表数据集中所有样本难度分值的标准差, 是时间依赖权重, 是正系数,代表自适应难度调整率; ;其中, 代表当前样本的解题方案长度, 代表整个候选数据集中所有解题方案的平均长度; 是一个控制函数对长度偏差敏感度的方差参数; ;其中, 代表当前样本x在最近几个训练周期内的平均奖励值; 代表所有样本的平均奖励值; 为自适应调节机制的参数。
2.根据权利要求1所述的方法,其特征在于,依据预设的数据质量、多样性及难度评估指标,从原始数学问题数据中筛选,得到候选训练集,包括:根据预设的数据质量,从多个数学竞赛和论坛中汇集原始数学问题数据,过滤数据质量低于设定阈值的数据;依据数学问题领域分类标准筛选过滤后的原始数学问题数据,确保多样性;设定难度评估指标,采用基线模型推理评估,对筛选后的原始数学问题数据进行难度分级,得到候选训练集。
3.根据权利要求1所述的方法,其特征在于,对所述候选训练集进行难度过滤,构建自适应训练课程,包括:分别部署不同尺寸的基座大语言模型对候选训练集进行多次推理,针对不同正确率区间划分静态的初始难度等级;采用基于高斯分布的函数,动态追踪最优的难度水平;根据所述初始难度等级,实施自适应难度调节机制,设计随着训练进程演变的时间依赖权重,构建自适应训练课程。
4.根据权利要求1所述的方法,其特征在于,根据候选训练集的解答推理过程和奖励分数进一步过滤候选训练集,包括:定义思维链复杂度,通过高斯分布采样不同复杂程度的解题推理过程,通过时间依赖权重进行自适应调整;基于正确性和格式计算奖励,捕获候选训练集的奖励值在训练过程中的动态变化规律;根据奖励分数,进一步过滤掉候选训练集中全对或全错的样本。
5.根据权利要求1所述的方法,其特征在于,基于进一步过滤出的候选训练集和数据有效性分数,通过设置随训练进程衰减的温度参数和概率阈值,为当前训练周期动态挑选数据子集,包括:基于所述数据有效性分数和随训练进程衰减的温度参数,计算进一步过滤出的候选训练集中各样本的采样概率;依据预设的概率阈值动态挑选采样概率大于概率阈值的样本,构成当前训练周期的数据子集。
6.根据权利要求1所述的方法,其特征在于:所述训练的奖励函数被定义为多级结构,其根据模型输出答案的正确性及格式合规性,分别给予正奖励、轻微惩罚或重度惩罚。
7.根据权利要求1所述的方法,其特征在于,还包括:重复执行S4至S6的步骤,并在每次迭代前,根据强化学习模型最新的能力水平重新执行S2,以更新候选训练集中所有样本的数据有效性分数,直至模型性能收敛。
8.一种基于动态数据选择的强化学习模型训练装置,其特征在于,用于执行如权利要求1所述的基于动态数据选择的强化学习模型训练方法,该装置包括:数据集构建模块,用于依据预设的数据质量、多样性及难度评估指标,从原始数学问题数据池中筛选,得到候选训练集;有效性评估模块,用于针对所述候选训练集中的每个训练样本,计算其数据有效性分数;自适应课程模块,用于对所述候选训练集进行难度过滤,构建自适应训练课程;进一步过滤模块,用于根据候选训练集的解答推理过程和历史奖励分数进一步过滤候选训练集;数据挑选模块,用于基于进一步过滤出的候选训练集和数据有效性分数,通过设置随训练进程衰减的温度参数和概率阈值,为当前训练周期动态挑选数据子集;模型训练模块,用于将挑选的数据子集投入强化学习模型训练,根据正确性奖励和格式奖励优化训练强化学习模型。
9.一种电子设备,其特征在于,包括:一个或多个处理器;存储器,用于存储一个或多个程序;当所述一个或多个程序被所述一个或多个处理器执行,使得所述一个或多个处理器实现如权利要求1-7任一项所述的方法。