有效
基于大模型的交互方法、训练方法、装置及智能体
彭星源、邓爱文、蒋正翔、徐扬凯、刘朝润、石乐同、丛士钧、丁举鹏、王桂彬、李晓辉、付晓寅、贾磊、王海峰
北京百度网讯科技有限公司
彭
彭星源 专利 9
百度在线网络技术(北京)有限公司语音识别语音音频处理乐器与声学
邓
邓爱文 专利 2
北京百度网讯科技有限公司物理仪器语音识别语音音频处理
蒋
蒋正翔 专利 17
北京百度网讯科技有限公司语音识别语音音频处理乐器与声学
徐
徐扬凯 专利 21
百度在线网络技术(北京)有限公司语音音频处理乐器与声学物理仪器
刘
刘朝润 专利 2
北京百度网讯科技有限公司物理仪器语音识别语音音频处理
石
石乐同 专利 3
北京百度网讯科技有限公司语音识别语音音频处理乐器与声学
丛
丛士钧 专利 12
北京百度网讯科技有限公司计算模型系统计算技术物理仪器
丁
丁举鹏 专利 2
北京百度网讯科技有限公司物理仪器语音识别语音音频处理
王
王桂彬 专利 31
百度在线网络技术(北京)有限公司计算模型系统计算技术物理仪器
李
李晓辉 专利 8
北京百度网讯科技有限公司物理仪器语音识别语音音频处理
付
付晓寅 专利 40
北京百度网讯科技有限公司语音识别语音音频处理乐器与声学
贾
贾磊 专利 107
百度在线网络技术(北京)有限公司语音识别语音音频处理乐器与声学
王
王海峰 专利 375
北京百度网讯科技有限公司自然语言处理机器学习特定数据处理
摘要
本公开提供了基于大模型的交互方法、训练方法、装置及智能体,涉及人工智能领域,尤其涉及语音识别、语音交互、深度学习、大模型等技术领域,可以应用于知识搜索、自动驾驶、智能客服、智能语音控制、智慧电商、AI医疗等应用场景。基于大模型的交互方法包括:获取需求语音;对需求语音进行语音识别,得到表征需求语义的语音识别特征;利用大模型处理语音识别特征,得到回复文本,其中,回复文本包括顺序排列的多个回复字,多个回复字中的目标回复字是基于大模型的注意力融合层处理语音识别特征和关联回复字特征确定的,关联回复字特征与排列在目标回复字之前的关联回复字相关。
1.一种基于大模型的交互方法,包括:获取需求语音;对所述需求语音进行语音识别,得到表征需求语义的语音识别特征;利用大模型处理所述语音识别特征,得到回复文本,其中,所述回复文本包括顺序排列的多个回复字,多个所述回复字中的目标回复字是基于所述大模型的注意力融合层处理所述语音识别特征和关联回复字特征确定的,所述关联回复字特征与排列在所述目标回复字之前的关联回复字相关。
2.根据权利要求1所述的方法,其中,所述利用大模型处理所述语音识别特征,得到回复文本包括:利用文本特征融合层处理表征所述关联回复字的初始关联回复字特征,得到所述关联回复字特征,所述大模型包括所述文本特征融合层;利用所述注意力融合层处理所述语音识别特征和所述关联回复字特征,得到目标回复字特征;以及基于所述目标回复字特征确定所述目标回复字。
3.根据权利要求2所述的方法,其中,所述文本特征融合层和所述注意力融合层均包括N个,N为大于1的整数;其中,所述利用所述注意力融合层处理所述语音识别特征和所述关联回复字特征,得到目标回复字特征包括:利用第n注意力融合层处理所述语音识别特征,以及第n关联回复字特征,得到第n中间融合特征,N≥n>1,第n关联回复字特征是基于第n文本特征融合层处理第n-1中间融合特征确定的,第1关联回复字特征是利用第1文本特征融合层处理所述初始关联回复字特征确定的;以及在n=N的情况下,基于第N中间融合特征确定所述目标回复字特征。
4.根据权利要求1所述的方法,其中,所述对所述需求语音进行语音识别,得到表征需求语义的语音识别特征包括:对所述需求语音进行特征提取,得到初始语音特征;对所述初始语音特征解码,得到多个初始解码特征,所述初始解码特征表征所述需求语音中的需求字;基于注意力机制融合多个所述初始解码特征和所述初始语音特征,得到所述语音识别特征。
5.根据权利要求4所述的方法,其中,所述基于注意力机制融合多个所述初始解码特征和所述初始语音特征,得到所述语音识别特征包括:基于注意力机制融合所述初始解码特征和所述初始语音特征,得到与所述需求字对应的需求字音频特征;将多个所述需求字音频特征进行全局特征融合,得到中间语音特征;基于注意力机制融合所述中间语音特征和多个所述初始解码特征,得到所述语音识别特征。
6.一种大模型的训练方法,包括:获取样本需求语音和标签回复文本;对所述样本需求语音进行语音识别,得到样本语音识别特征;利用初始大模型处理所述样本语音识别特征,得到样本回复文本,其中,所述样本回复文本包括顺序排列的多个样本回复字,多个所述样本回复字中的样本目标回复字是基于所述初始大模型的初始注意力融合层处理所述样本语音识别特征和样本关联回复字特征确定的,所述样本关联回复字特征与排列在所述样本目标回复字之前的关联回复字相关;基于所述样本回复文本和所述标签回复文本之间的回复文本差异训练所述初始大模型,得到训练后的大模型。
7.根据权利要求6所述的方法,其中,所述初始大模型是对扩展大模型进行训练确定的,所述扩展大模型是基于扩展注意力融合层更新预训练的基础大模型的网络结构得到的。
8.根据权利要求7所述的方法,其中,所述基础大模型包括多级基础特征融合网络,所述基础特征融合网络包括级联的基础文本特征融合层与基础前馈层;所述扩展大模型包括多级扩展特征融合网络,所述扩展特征融合网络包括级联的所述基础文本特征融合层、扩展注意力融合层和所述基础前馈层。
9.根据权利要求7或8所述的方法,其中,所述初始大模型是基于如下训练操作确定的:获取扩展大模型和预训练的基础大模型,以及样本扩展需求文本和标签扩展回复文本;利用所述基础大模型处理所述样本扩展需求文本,得到样本扩展需求文本特征;利用所述扩展大模型处理所述样本扩展需求文本特征,得到样本扩展回复文本;以及基于所述样本扩展回复文本和标签扩展回复文本之间的差异,训练所述扩展大模型,得到所述初始大模型。
10.根据权利要求6所述的方法,其中,所述样本语音识别特征是利用语音识别大模型处理所述样本需求语音确定的;所述基于所述样本回复文本和所述标签回复文本之间的回复文本差异训练所述初始大模型,得到训练后的大模型包括:基于所述样本回复文本和所述标签回复文本之间的回复文本差异,确定回复文本损失值;以及基于回复文本损失值和需求特征损失值,调整所述语音识别大模型和所述初始大模型各自的模型参数,得到训练后的大模型,其中,所述需求特征损失值表征所述样本语音识别特征与预设的标签需求文本特征之间的差异。
11.根据权利要求10所述的方法,其中,所述标签需求文本特征是利用预设大模型处理样本需求文本确定的,所述样本需求语音是基于所述样本需求文本确定的。
12.根据权利要求11所述的方法,其中,所述样本需求语音包括表征所述样本需求文本的样本需求文本音频信息,以及表征语音环境声音的样本环境音频信息。
13.根据权利要求11所述的方法,其中,所述样本需求语音包括多个,多个所述样本需求语音具有不同的样本语音属性,所述样本语音属性包括以下至少一项:音色属性、语速属性、性别属性、口音属性。
14.一种基于大模型的交互装置,包括:第一获取模块,用于获取需求语音;第一语音识别模块,用于对所述需求语音进行语音识别,得到表征需求语义的语音识别特征;回复文本获得模块,用于利用大模型处理所述语音识别特征,得到回复文本,其中,所述回复文本包括顺序排列的多个回复字,多个所述回复字中的目标回复字是基于所述大模型的注意力融合层处理所述语音识别特征和关联回复字特征确定的,所述关联回复字特征与排列在所述目标回复字之前的关联回复字相关。
15.根据权利要求14所述的装置,其中,所述回复文本获得模块包括:关联回复字特征获得子模块,用于利用文本特征融合层处理表征所述关联回复字的初始关联回复字特征,得到所述关联回复字特征,所述大模型还包括所述文本特征融合层;目标回复字特征获得子模块,用于利用所述注意力融合层处理所述语音识别特征和所述关联回复字特征,得到目标回复字特征;以及目标回复字获得子模块,用于基于所述目标回复字特征确定所述目标回复字。
16.根据权利要求15所述的装置,其中,所述文本特征融合层和所述注意力融合层均包括N个,N为大于1的整数;其中,所述目标回复字特征获得子模块包括:第一获得单元,用于利用第n注意力融合层处理所述语音识别特征,以及第n关联回复字特征,得到第n中间融合特征,N≥n>1,第n关联回复字特征是基于第n文本特征融合层处理第n-1中间融合特征确定的,第1关联回复字特征是利用第1文本特征融合层处理所述初始关联回复字特征确定的;以及目标回复字特征确定单元,用于在n=N的情况下,基于第N中间融合特征确定所述目标回复字特征。
17.根据权利要求14所述的装置,其中,所述第一语音识别模块包括:初始语音特征获得子模块,用于对所述需求语音进行特征提取,得到初始语音特征;第一解码子模块,用于对所述初始语音特征解码,得到多个初始解码特征,所述初始解码特征表征所述需求语音中的需求字;语音识别特征获得子模块,用于基于注意力机制融合多个所述初始解码特征和所述初始语音特征,得到所述语音识别特征。
18.根据权利要求17所述的装置,其中,所述语音识别特征获得子模块包括:需求字音频特征获得单元,用于基于注意力机制融合所述初始解码特征和所述初始语音特征,得到与所述需求字对应的需求字音频特征;中间语音特征获得单元,用于将多个所述需求字音频特征进行全局特征融合,得到中间语音特征;语音识别特征获得单元,用于基于注意力机制融合所述中间语音特征和多个所述初始解码特征,得到所述语音识别特征。
19.一种大模型的训练装置,包括:第二获取模块,用于获取样本需求语音和标签回复文本;第二语音识别模块,用于对所述样本需求语音进行语音识别,得到样本语音识别特征;样本回复文本获得模块,用于利用初始大模型处理所述样本语音识别特征,得到样本回复文本,其中,所述样本回复文本包括顺序排列的多个样本回复字,多个所述样本回复字中的样本目标回复字是基于所述初始大模型的初始注意力融合层处理所述样本语音识别特征和样本关联回复字特征确定的,所述样本关联回复字特征与排列在所述样本目标回复字之前的关联回复字相关;训练模块,用于基于所述样本回复文本和所述标签回复文本之间的回复文本差异训练所述初始大模型,得到训练后的大模型。
20.根据权利要求19所述的装置,其中,所述初始大模型是对扩展大模型进行训练确定的,所述扩展大模型是基于扩展注意力融合层更新预训练的基础大模型的网络结构得到的。
21.根据权利要求20所述的装置,其中,所述基础大模型包括多级基础特征融合网络,所述基础特征融合网络包括级联的基础文本特征融合层与基础前馈层;所述扩展大模型包括多级扩展特征融合网络,所述扩展特征融合网络包括级联的所述基础文本特征融合层、扩展注意力融合层和所述基础前馈层。
22.根据权利要求20或21所述的装置,其中,所述初始大模型是基于如下训练操作确定的:获取扩展大模型和预训练的基础大模型,以及样本扩展需求文本和标签扩展回复文本;利用所述基础大模型处理所述样本扩展需求文本,得到样本扩展需求文本特征;利用所述扩展大模型处理所述样本扩展需求文本特征,得到样本扩展回复文本;以及基于所述样本扩展回复文本和标签扩展回复文本之间的差异,训练所述扩展大模型,得到所述初始大模型。
23.根据权利要求19所述的装置,其中,所述样本语音识别特征是利用语音识别大模型处理所述样本需求语音确定的;所述训练模块包括:回复文本损失值确定子模块,用于基于所述样本回复文本和所述标签回复文本之间的回复文本差异,确定回复文本损失值;以及训练子模块,用于基于回复文本损失值和需求特征损失值,调整所述语音识别大模型和所述初始大模型各自的模型参数,得到训练后的大模型,其中,所述需求特征损失值表征所述样本语音识别特征与预设的标签需求文本特征之间的差异。
24.根据权利要求23所述的装置,其中,所述标签需求文本特征是利用预设大模型处理样本需求文本确定的,所述样本需求语音是基于所述样本需求文本确定的。
25.根据权利要求24所述的装置,其中,所述样本需求语音包括表征所述样本需求文本的样本需求文本音频信息,以及表征语音环境声音的样本环境音频信息。
26.根据权利要求24所述的装置,其中,所述样本需求语音包括多个,多个所述样本需求语音具有不同的样本语音属性,所述样本语音属性包括以下至少一项:音色属性、语速属性、性别属性、口音属性。
27.一种智能体,包括:输入模块,用于接收输入信息;处理模块,用于基于所述输入模块接收的所述输入信息确定目标任务,基于所述目标任务确定大模型,通过调用所述大模型执行权利要求1至5中任一项所述的方法,或者通过调用初始大模型执行权利要求6至13中任一项所述的方法,得到输出信息;输出模块,用于输出所述处理模块得到的所述输出信息。
28.一种电子设备,包括:至少一个处理器;以及与所述至少一个处理器通信连接的存储器;其中,所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,以使所述至少一个处理器能够执行权利要求1至13中任一项所述的方法。
29.一种存储有计算机指令的非瞬时计算机可读存储介质,其中,所述计算机指令用于使所述计算机执行根据权利要求1至13中任一项所述的方法。
30.一种计算机程序产品,包括计算机程序,所述计算机程序在被处理器执行时实现根据权利要求1至13中任一项所述的方法。



