有效
基于LLM的样本增强和网络迭代训练方法、装置和设备
张可、邵天浩、范强、黄山、周晓磊、张骁雄、徐歆尧、王芳潇、严浩
中国人民解放军国防科技大学
张
张可 专利 90
中国人民解放军国防科技大学卫星定位无线电定位导航物理仪器
邵
邵天浩 专利 1
中国人民解放军国防科技大学知识系统生物模型计算计算模型系统
范
范强 专利 47
中国人民解放军国防科技大学数据存储检索电子数据处理计算技术
黄
黄山 专利 30
中国人民解放军国防科技大学计算技术生物模型计算计算模型系统
周
周晓磊 专利 43
中国人民解放军国防科技大学数据存储检索生物模型计算计算模型系统
张
张骁雄 专利 54
中国人民解放军国防科技大学数据存储检索计算模型系统电子数据处理
徐
徐歆尧 专利 17
中国科学院自动化研究所生物模型计算计算模型系统计算技术
王
王芳潇 专利 33
中央军委装备发展部第六十三研究所电子数据处理计算技术物理仪器
严
严浩 专利 44
中国人民解放军国防科技大学数据存储检索生物模型计算计算模型系统
摘要
本申请涉及基于LLM的样本增强和网络迭代训练方法、装置和设备,所述方法采用LLM进行样本增强,并提出一种基于特征的文本化方法和逐步提示方法,在使用尽可能少的提示词和输入词的同时,可以使LLM的输出尽可能地符合人类预期;基于元学习思想提出一种网络迭代训练方法,使用基础网络加迭代训练的方式,提升网络在不同任务上的泛化能力。
1.一种基于LLM的样本增强和网络迭代训练方法,其特征在于,包括步骤:获取若干个不同基础规划任务的问题背景和对应的初始训练数据;将所述问题背景和对应的初始训练数据进行文本化处理,得到问题背景文本描述和训练数据文本描述;根据所述问题背景文本描述采用基于特征的逐步提示方法对LLM进行提示,生成结构化提示;具体包括:从所述问题背景文本描述中选择第 i 类特征 ,构建文本化的特征集合;所述特征集合包含了若干具体特征;采用特征集合中的特征来描述提示样本;采用所述提示样本对LLM进行提示,并用测试问题验证LLM是否能够得出正确回答,如果得不到正确回答,则继续从所述问题背景文本描述中选择一类特征,继续生成提示样本对LLM进行提示、测试;如果能得到正确回答,则得到结构化提示;将所述结构化提示和所述训练数据文本描述输入到用于具体任务的大语言模型中,生成各基础规划任务的增强训练数据;采用每个基础规划任务的增强训练数据对基础网络进行训练,得到基础模型;当遇到新规划任务时,基于新规划任务对所述基础模型进行迭代训练,得到新规划任务的专用网络;其中在迭代训练过程中将所述基础模型和不同新任务的仿真引擎进行交互,得到交互样本,将交互样本据经过LLM增强后,继续训练基础模型;经过若干轮迭代训练后,使用迭代更新后的网络替换原有基础模型,继续和仿真引擎交互生成新的训练数据,直到迭代后的网络收敛到能够完成任务,得到规划任务的专用模型;所述任务包括自动驾驶领域的规划任务、机器人控制领域的各类机器人执行装配零件、搬运物品的复杂任务;具体包括:步骤S10:采用基础网络与仿真引擎或环境交互,生成交互样本,将交互样本经过LLM增强,得到增强样本;所述基础网络是第k代网络;步骤S20:将增强样本存入样本池,并依据预设剔除规则剔除样本池中的旧样本;所述预设剔除规则为:除了第 k - N 代基础网络至第 k 代基础网络产生的样本之外,所有样本都从样本池中被剔除;步骤S30:从样本池中随机选择,或者按权重选择一定量的样本,用于训练目标网络,将目标网络初始化为基础网络,在每轮训练中,更新其内层网络的参数;步骤S40:循环执行步骤S30,每当循环了 M 次后,则使用目标网络迭代更新基础网络,并将 k 的值加1;触发预设剔除规则,对样本池中样本进行剔除;每当循环到 M +1次后,更新目标网络外层网络的参数;步骤S10和步骤S20独立于后续步骤,将会一直循环执行,直到训练结束;其中,基础网络由两部分组成,定义两部分网络的参数为 和 ; 为外层网络的参数, 为内层网络的参数;网络迭代训练方法还适用于强化学习;在训练过程中策略梯度的方法更新内层网络的参数;更新公式为:其中, 、 分别为更新后和更新前的内层网络的参数; 为表示学习率, N 表示每轮训练使用的轨迹总数, 表示第 条轨迹的奖励之和, 和 分别表示第 条轨迹中的第 个状态和动作, 为外层网络, 表示轨迹的长度; 为梯度下降操作;在训练过程中外层网络在所有子任务样本的损失值总和上使用梯度下降法来更新参数。
2.根据权利要求1所述的基于LLM的样本增强和网络迭代训练方法,其特征在于,将所述问题背景和对应的初始训练数据进行文本化处理,得到问题背景文本描述和训练数据文本描述,包括:将描述问题背景的特征文本化,得到问题背景文本描述,并将问题背景文本描述划分为物理特征、结构特征、语义特征和关联特征;所述物理特征用于描述环境和对象物理信息的特征;所述结构特征用于描述环境中结构信息的特征;所述语义特征用于描述环境中的语义信息和含义的特征;所述关联特征用于描述不同特征之间的关联和相互作用的特征;将初始训练数据进行文本化处理,得到训练数据文本描述,将训练数据文本描述划分为时间特征、上下文特征和行为特征;所述时间特征用于描述与时间相关的信息的特征;所述上下文特征用于描述环境和对象上下文信息的特征;所述行为特征用于描述对象和环境行为的特征。
3.根据权利要求1所述的基于LLM的样本增强和网络迭代训练方法,其特征在于,采用每个基础规划任务的增强训练数据对基础网络进行训练,得到基础模型,包括:选择若干个基础任务,将对应的增强训练数据划分为支持集和查询集;基于元学习思想,所述基础网络由两部分组成,定义两部分网络的参数为 和 ; 为外层网络的参数, 为内层网络的参数;采用每个基础任务的所述支持集对对应的所述基础网络进行训练,在训练过程中根据各个基础任务的损失对各自内层网络的参数进行更新;采用每个基础任务的所述查询集对对应的所述基础网络进行训练,在训练过程中根据各个基础任务对应的基础网络的损失对各自内层网络的参数进行更新;在内层网络的参数更新完后,采用每个基础任务的所述查询集对对应的所述基础网络进行训练,在训练过程中所有基础任务对应的基础网络的损失之和对每个基础网络的外层网络的参数进行更新,得到训练好的基础网络,作为基础模型。
4.根据权利要求3所述的基于LLM的样本增强和网络迭代训练方法,其特征在于,内层网络的参数进行更新过程包括:将支持样本输入到基础网络中,计算输出和标签的交叉熵损失,然后通过梯度下降法回传损失并更新内层网络的参数。
5.根据权利要求3所述的基于LLM的样本增强和网络迭代训练方法,其特征在于,外层网络的参数进行更新过程包括:将查询样本输入到基础网络中,计算每个基础任务对应的基础网络的输出和标签的交叉熵损失,并求和得到总损失,然后通过梯度下降法回传总损失并更新外层网络的参数。
6.一种基于LLM的样本增强和网络迭代训练装置,其特征在于,包括:训练数据获取模块,用于获取若干个不同基础规划任务的问题背景和对应的初始训练数据;文本化处理模块,用于将所述问题背景和对应的初始训练数据进行文本化处理,得到问题背景文本描述和训练数据文本描述;提示确定模块,用于根据所述问题背景文本描述采用基于特征的逐步提示方法对LLM进行提示,生成结构化提示;具体包括:从所述问题背景文本描述中选择第 i 类特征 ,构建文本化的特征集合;所述特征集合包含了若干具体特征;采用特征集合中的特征来描述提示样本;采用所述提示样本对LLM进行提示,并用测试问题验证LLM是否能够得出正确回答,如果得不到正确回答,则继续从所述问题背景文本描述中选择一类特征,继续生成提示样本对LLM进行提示、测试;如果能得到正确回答,则得到结构化提示;样本增强模块,用于将所述结构化提示和所述训练数据文本描述输入到用于具体任务的大语言模型中,生成各基础规划任务的增强训练数据;基础模型训练模块,用于采用每个基础规划任务的增强训练数据对基础网络进行训练,得到基础模型;引用了网络迭代的方法网络迭代训练模块,用于当遇到新规划任务时,基于新规划任务对所述基础模型进行迭代训练,得到新规划任务的专用网络;其中在迭代训练过程中将所述基础模型和不同新任务的仿真引擎进行交互,得到交互样本,将交互样本据经过LLM增强后,继续训练基础模型;经过若干轮迭代训练后,使用迭代更新后的网络替换原有基础模型,继续和仿真引擎交互生成新的训练数据,直到迭代后的网络收敛到能够完成任务,得到规划任务的专用模型;所述任务包括自动驾驶领域的规划任务、机器人控制领域的各类机器人执行装配零件、搬运物品的复杂任务;具体包括:步骤S10:采用基础网络与仿真引擎或环境交互,生成交互样本,将交互样本经过LLM增强,得到增强样本;所述基础网络是第k代网络;步骤S20:将增强样本存入样本池,并依据预设剔除规则剔除样本池中的旧样本;所述预设剔除规则为:除了第 k - N 代基础网络至第 k 代基础网络产生的样本之外,所有样本都从样本池中被剔除;步骤S30:从样本池中随机选择,或者按权重选择一定量的样本,用于训练目标网络,将目标网络初始化为基础网络,在每轮训练中,更新其内层网络的参数;步骤S40:循环执行步骤S30,每当循环了 M 次后,则使用目标网络迭代更新基础网络,并将 k 的值加1;触发预设剔除规则,对样本池中样本进行剔除;每当循环到 M +1次后,更新目标网络外层网络的参数;步骤S10和步骤S20独立于后续步骤,将会一直循环执行,直到训练结束;其中,基础网络由两部分组成,定义两部分网络的参数为 和 ; 为外层网络的参数, 为内层网络的参数;网络迭代训练装置还适用于强化学习;在训练过程中策略梯度的方法更新内层网络的参数;更新公式为:其中, 、 分别为更新后和更新前的内层网络的参数; 为表示学习率, N 表示每轮训练使用的轨迹总数, 表示第 条轨迹的奖励之和, 和 分别表示第 条轨迹中的第 个状态和动作, 为外层网络, 表示轨迹的长度; 为梯度下降操作;在训练过程中外层网络在所有子任务样本的损失值总和上使用梯度下降法来更新参数。
7.一种计算机设备,包括存储器和处理器,其特征在于,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现权利要求1至5任一项所述的基于LLM的样本增强和网络迭代训练方法的步骤。



