在审
基于自训练的大模型代码推理强化学习方法及装置
摘要
本发明涉及大语言模型技术领域,特别涉及一种基于自训练的大模型代码推理强化学习方法及装置,其中,方法包括:采集代码推理领域的多个训练数据,以提取代码推理问题和测试用例构建初始训练数据集;利用初始训练数据集进行过滤与组装,得到新训练数据集,并利用新训练数据集对目标大语言模型进行参数更新,以得到训练后的大语言模型;估计训练后的大语言模型的中间推理状态的价值目标数据,并利用价值目标数据对预先构建的价值模型进行训练,利用训练后的价值模型辅助训练后的大语言模型解码。由此,解决了现有大语言模型推理强化方法在复杂代码推理场景下无法同时保证较低的数据收集成本、良好的泛化能力、令人满意的强化结果和训练效率等问题。
暂无引用专利



