在审

基于提示级优先采样和经验平滑的策略优化方法及装置

贺颖、朱欣欣、侯皓文、贺彪、原志路
深圳大学

摘要

本申请涉及机器学习模型技术领域,公开了一种基于提示级优先采样和经验平滑的策略优化方法及装置,包括:根据提示集合中各提示的优先级,从提示集合中采样得到当前训练批次的提示;再利用当前策略模型生成响应并获取对应的奖励;根据提示的历史奖励统计量和当前获取的奖励,对提示的奖励统计量进行平滑更新后,更新提示在提示集合中的优先级;根据更新后的平滑奖励统计量和因非均匀采样引入的偏差补偿信息,对当前策略模型进行策略优化更新,得到更新后的策略模型并作为新一轮训练的当前策略模型,重复执行训练操作,直至满足训练停止条件为止。本申请能够提高大型语言模型强化学习训练的稳定性和样本利用效率,实现模型性能的高效优化。

暂无引用专利