1.一种文本生成方法,其特征在于,包括:获取训练文本集以及初始大语言模型的模型参数,所述训练文本集包括文本样本和生成标签,所述模型参数包括:权重参数、动量参数、学习率、权重衰减率和衰减参数;将所述文本样本输入所述初始大语言模型进行文本预测,利用所述模型参数进行前向传播,得到所述文本样本的预测文本;基于所述预测文本和所述生成标签得到损失函数,并计算所述损失函数对于所述模型参数的梯度值,利用所述衰减参数和所述梯度值更新所述动量参数,以及利用所述学习率、所述权重衰减率和更新后的所述动量参数更新所述权重参数,多次迭代所述权重参数,直至对所述初始大语言模型训练完成,得到目标大语言模型;获取待处理文本,并将所述待处理文本输入所述目标大语言模型,得到目标生成文本。
2.根据权利要求1所述的文本生成方法,其特征在于,所述利用所述衰减参数和所述梯度值更新所述动量参数,包括:根据所述衰减参数和前一时刻动量参数计算第一数值;根据所述衰减参数和所述梯度值计算第二数值;根据所述第一数值和所述第二数值得到当前时刻动量参数,将所述当前时刻动量参数作为更新后的所述动量参数。
3.根据权利要求2所述的文本生成方法,其特征在于,所述利用所述学习率、所述权重衰减率和更新后的所述动量参数更新所述权重参数,包括:根据前一时刻权重参数和所述权重衰减率计算第三数值;将所述第三数值和所述当前时刻动量参数作为符号函数的输入,计算第四数值;根据所述学习率和所述第四数值计算第五数值;计算前一时刻权重参数和所述第五数值的差值得到当前时刻权重参数,将所述当前时刻权重参数作为更新后的所述权重参数。
4.根据权利要求1所述的文本生成方法,其特征在于,所述权重参数包括线性层的偏置值、归一化层的缩放值、归一化层的平移值和其他参数;所述学习率的计算过程包括以下步骤:若所述权重参数为所述偏置值、所述缩放值或所述平移值,则根据全局相对学习率得到所述学习率;若所述权重参数为所述其他参数,则根据所述权重参数的均方根和所述全局相对学习率得到所述学习率。
5.根据权利要求4所述的文本生成方法,其特征在于,所述衰减率的计算过程包括以下步骤:若所述权重参数为所述偏置值、所述缩放值或所述平移值,则将所述衰减率设为零;若所述权重参数为所述其他参数,则将所述衰减率设为大于零的预设常数。
6.根据权利要求3所述的文本生成方法,其特征在于,所述模型参数还包括梯度累计指标,所述利用所述衰减参数和所述梯度值更新所述动量参数,以及利用所述学习率、所述权重衰减率和更新后的所述动量参数更新所述权重参数,包括:利用当前所述动量参数、所述衰减参数和梯度累计指标计算第六数值,并根据所述梯度值、所述衰减参数和所述权重参数中的权重数量计算第七数值,基于所述第六数值和所述第七数值的和得到更新后的所述动量参数;将所述梯度累计指标和所述第五数值相乘得到第八数值;计算当前所述权重参数和所述第八数值的差值得到更新后的所述权重参数。
7.根据权利要求6所述的文本生成方法,其特征在于,所述梯度累计指标的计算过程包括:获取当前迭代的迭代时刻;若所述迭代时刻被所述权重数量整除,则所述梯度累计指标为第一预设数值,否则所述梯度累计指标为第二预设数值。
8.一种文本生成装置,其特征在于,包括:数据获取模块:用于获取训练文本集以及初始大语言模型的模型参数,所述训练文本集包括文本样本和生成标签,所述模型参数包括:权重参数、动量参数、学习率、权重衰减率和衰减参数;文本预测模块:用于将所述文本样本输入所述初始大语言模型进行文本预测,利用所述模型参数进行前向传播,得到所述文本样本的预测文本;参数更新模块:用于基于所述预测文本和所述生成标签得到损失函数,并计算所述损失函数对于所述模型参数的梯度值,利用所述衰减参数和所述梯度值更新所述动量参数,以及利用所述学习率、所述权重衰减率和更新后的所述动量参数更新所述权重参数,多次迭代所述权重参数,直至对所述初始大语言模型训练完成,得到目标大语言模型;文本生成模块:用于获取待处理文本,并将所述待处理文本输入所述目标大语言模型,得到目标生成文本。
9.一种电子设备,其特征在于,所述电子设备包括存储器和处理器,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现权利要求1至7任一项所述的文本生成方法。
10.一种存储介质,所述存储介质存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至7中任一项所述的文本生成方法。