1.一种大语言模型越狱攻击的防御方法,其特征在于,包括:将文本数据输入大语言模型,通过预先构建的探针采集模型采集大语言模型的各个解码器层输出的高维中间特征并进行降维,得到多个低维中间特征,所述探针采集模型包括若干个特征提取模块,所述大语言模型基于转换器模型构建得到;计算所述低维中间特征与预设的有害特征中心之间的第一距离,以及所述低维中间特征与预设的安全特征中心之间的第二距离,根据所述第一距离与所述第二距离之间的差值,得到向量距离差异,并根据所述向量距离差异与预设的差异阈值之间的比较结果,判断是否存在越狱攻击风险;响应于存在越狱攻击风险,将大语言模型中的最后若干个解码器层作为关键层,以所述关键层的向量距离差异的最大化为目标函数,构建扰动优化模型,对所述扰动优化模型进行迭代求解,得到最优扰动项,并将所述最优扰动项添加至对应的所述高维中间特征,得到安全中间特征。
2.根据权利要求1所述的大语言模型越狱攻击的防御方法,其特征在于,所述通过预先构建的探针采集模型采集大语言模型的各个解码器层输出的高维中间特征并进行降维,得到多个低维中间特征的步骤包括:将各个特征提取模块分别嵌入大语言模型的各个解码器层的输出位置,所述特征提取模块包括线性变换模块和压缩降维模块,所述解码器层包括多头注意力模块和前馈神经网络模块;通过所述线性变换模块采集各个解码器层输出的高维中间特征,并将所述高维中间特征映射至低维特征空间,得到第一低维中间特征;通过所述压缩降维模块对所述第一低维中间特征进行特征压缩,得到各个解码器层对应的低维中间特征。
3.根据权利要求1所述的大语言模型越狱攻击的防御方法,其特征在于,所述以所述关键层的向量距离差异的最大化为目标函数,构建扰动优化模型,对所述扰动优化模型进行迭代求解,得到最优扰动项的步骤包括:以所述关键层的向量距离差异的最大化为目标函数,以扰动项为优化变量,以扰动幅度小于等于扰动幅度阈值为约束条件,构建扰动优化模型;将零向量作为所述扰动项的初始值,对所述扰动优化模型进行迭代求解,得到最优扰动项;其中,采用如下公式表示所述目标函数:式中,D 1 表示第一距离,D 2 表示第二距离, 表示最大值参数函数, 表示扰动幅度阈值, 表示扰动项。
4.根据权利要求3所述的大语言模型越狱攻击的防御方法,其特征在于,所述扰动幅度阈值的计算步骤包括:计算所述关键层对应的有害特征中心与安全特征中心之间的基准距离,判断所述基准距离是否在距离阈值范围内,若是,则根据扰动幅度初始范围,采用线性插值法,计算第一扰动幅度,并将所述第一扰动幅度作为扰动幅度阈值;反之,则将所述基准距离分别与距离阈值范围上限值和距离阈值范围下限值相比较;响应于所述基准距离大于所述距离阈值范围上限值,根据所述扰动幅度初始范围和所述基准距离,采用扰动缩小策略,计算第二扰动幅度,并将所述第二扰动幅度作为扰动幅度阈值;响应于所述基准距离小于所述距离阈值范围下限值,则根据所述扰动幅度初始范围和所述基准距离,采用扰动放大策略,计算第三扰动幅度,并将所述第三扰动幅度作为扰动幅度阈值。
5.根据权利要求4所述的大语言模型越狱攻击的防御方法,其特征在于,采用如下公式表示所述第一扰动幅度:式中, 表示第一扰动幅度, 表示扰动幅度初始范围下限值, 表示扰动幅度初始范围上限值, 表示距离阈值范围上限值, 表示距离阈值范围下限值,d表示基准距离;采用如下公式表示所述第二扰动幅度:式中, 表示第二扰动幅度,γ表示衰减系数;采用如下公式表示所述第三扰动幅度:式中, 表示第三扰动幅度。
6.根据权利要求1所述的大语言模型越狱攻击的防御方法,其特征在于,在所述得到安全中间特征的步骤之后,还包括:根据所述关键层的高维中间特征与安全中间特征之间的差异和所述关键层的模型参数调整幅度,构建损失函数;根据所述损失函数,对所述关键层的模型参数进行微调。
7.根据权利要求6所述的大语言模型越狱攻击的防御方法,其特征在于,采用如下公式表示所述损失函数:式中,θ表示调整后的关键层的模型参数,θ 0 表示调整前的关键层的模型参数,β表示正则化系数, 表示第t个关键层的安全中间特征, 表示第t-1个关键层的高维中间特征, 表示模型参数θ作用下的前向映射函数。
8.一种大语言模型越狱攻击的防御系统,其特征在于,包括:特征采集模块,用于将文本数据输入大语言模型,通过预先构建的探针采集模型采集大语言模型的各个解码器层输出的高维中间特征并进行降维,得到多个低维中间特征,所述探针采集模型包括若干个特征提取模块,所述大语言模型基于转换器模型构建得到;攻击判定模块,用于计算所述低维中间特征与预设的有害特征中心之间的第一距离,以及所述低维中间特征与预设的安全特征中心之间的第二距离,根据所述第一距离与所述第二距离之间的差值,得到向量距离差异,并根据所述向量距离差异与预设的差异阈值之间的比较结果,判断是否存在越狱攻击风险;主动防御模块,用于响应于存在越狱攻击风险,将大语言模型中的最后若干个解码器层作为关键层,以所述关键层的向量距离差异的最大化为目标函数,构建扰动优化模型,对所述扰动优化模型进行迭代求解,得到最优扰动项,并将所述最优扰动项添加至对应的所述高维中间特征,得到安全中间特征。
9.一种计算机设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至7中任一项所述方法的步骤。
10.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至7中任一项所述的方法的步骤。