有效
一种基于强化学习验证奖励的大语言模型日志异常自动检测方法与装置
王治华、费思源、高峰、金明辉、陕大诚、胡友琳、陈宏福、苏凡、韩政、程长春、陈培俊、吴晓博、方昊、刘洋、魏兴慎
国网上海市电力公司
王
王治华 专利 157
国网上海市电力公司知识系统模式识别信息通信行业流程
费
费思源 专利 15
国网上海市电力公司知识系统计算模型系统计算技术
高
高峰 专利 125
国网上海市电力公司知识系统电子数据处理计算技术
金
金明辉 专利 55
国网上海市电力公司电子数据处理计算技术物理仪器
陕
陕大诚 专利 11
南京南瑞信息通信科技有限公司数字信息传输电通信技术计算技术
胡
胡友琳 专利 47
国网上海市电力公司计算模型系统计算技术物理仪器
陈
陈宏福 专利 98
国网上海市电力公司知识系统模式识别信息通信行业流程
苏
苏凡 专利 29
国网上海市电力公司计算技术物理仪器电学
韩
韩政 专利 44
国网上海市电力公司电子数据处理计算技术物理仪器
程
程长春 专利 19
南京南瑞信息通信科技有限公司数字信息传输计算技术电通信技术
陈
陈培俊 专利 2
南京南瑞信息通信科技有限公司生物模型计算计算模型系统计算技术
吴
吴晓博 专利 2
南京南瑞信息通信科技有限公司电子数据处理计算技术物理仪器
方
方昊
机构 暂无技术领域 暂无
刘
刘洋 专利 23
南京南瑞信息通信科技有限公司计算技术物理仪器电子数据处理
魏
魏兴慎 专利 114
南京南瑞信息通信科技有限公司安全通信网络管理计算机安全
摘要
本发明涉及一种基于强化学习验证奖励的大语言模型日志异常自动检测方法与装置,其中方法包括步骤1、训练基于大语言模型的日志异常自动检测模型,通过滑动窗口划分日志序列,使用日志解析器进行日志解析,输入基于Transformer编码器的大语言模型进行语义提取,使用多层感知机和基于 Transformer 解码器的大语言模型进行维度映射,输入基于监督式微调与强化学习微调的大语言模型进行推理分析得出异常检测信息;步骤2、使用步骤1 所获基于大语言模型的自动化异常检测模型进行推理检测。本发明充分利用了语义向量提取模块优秀的语义提取能力、强化学习优化模块的文本生成能力,进一步去除了冗余信息,降低了强化学习优化模块的内存需求,提高了计算效率。
1.一种基于强化学习验证奖励的大语言模型日志异常自动检测方法,其特征在于,所述方法包括以下步骤:步骤1、训练日志异常自动检测模型;所述日志异常自动检测模型包括Transformer编码器、多层感知机和Transformer解码器;日志异常自动检测模型的训练包括:收集系统日志数据,使用日志解析器提取日志模板;日志模板输入Transformer编码器进行语义提取,使用多层感知机进行维度映射,使用Transformer解码器对映射后的语义向量进行条件生成,输出“推理过程+判定结论”的自然语言文本;将日志异常自动检测模型的输出映射为标量奖励,并采用基于策略梯度的强化学习,对日志异常自动检测模型进行微调;步骤2、使用步骤1所获得的自动化异常检测模型进行推理检测。
2.根据权利要求1所述的一种基于强化学习验证奖励的大语言模型日志异常自动检测方法,其特征在于,所述步骤1具体如下:步骤1.1、多种渠道收集系统日志数据,人工为数据分类,添加标签,提供训练数据集;步骤1.2、使用滑动窗口对训练数据集的原始日志数据划分序列,得到日志序列;将日志序列输入日志解析器,提取日志模板;步骤1.3、将日志模板输入Transformer编码器,Transformer编码器基于上下文理解,提取日志模板的语义向量;使用日志序列训练Transformer编码器,利用经8-bit INT量化技术的低秩适应技术微调基于Transformer编码器架构的大语言模型,冻结所述大语言模型的部分参数,训练更新所述大语言模型的部分参数;步骤1.4、语义向量序列输入多层感知机,选择非线性映射函数,进行非线性映射,将语义向量的维度从Transformer编码器的输出维度映射为Transformer解码器的输入维度;步骤1.5、经过映射的语义向量序列输入基于Transformer解码器的大语言模型,利用Transformer解码器的文本生成能力,根据答案模板生成日志序列异常与否的“推理生成+判定结论”的自然语言文本;Transformer解码器的训练与Transformer编码器的训练相同;步骤 1.6、构建确定性验证器,该确定性验证器将日志异常自动检测模型输出的自然语言文本映射为标量奖励,然后采用基于策略梯度的强化学习,对日志异常自动检测模型进行微调,以提升其对“日志序列是否异常”的判别与推理能力。
3.根据权利要求2所述的一种基于强化学习验证奖励的大语言模型日志异常自动检测方法,其特征在于,所述步骤1.3具体包含以下步骤:步骤1.31、冻结Transformer编码器的原始参数;步骤1.32、对Transformer编码器的原始预训练权重矩阵 进行对称8-bit整数量化,得到的整型权重矩阵 ;步骤1.33、在Transformer冻结参数的中间层中添加作用于键矩阵和值矩阵的可训练的低秩分解矩阵 ;步骤1.34、对应于步骤1.33 中的低秩分解矩阵 ,反量化原始预训练权重矩阵W并与低秩更新融合,得到的浮点权重矩阵 ;步骤1.35、在完成步骤1.34 的前向反量化融合后,在反向角度,Transformer编码器通过直通估计器传递量化梯度:其中, 为穿过量化-反量化的不可导路径,传回到量化权重的下游梯度, 则为从损失反向传回到 的上游梯度。
4.根据权利要求3所述的一种基于强化学习验证奖励的大语言模型日志异常自动检测方法,其特征在于,所述整型权重矩阵 的表达式为:其中,缩放因子 ;round( )函数为就近取整;clip( )函数通过强制截断将输入值限制在指定范围内,起到数值边界约束的作用,其数学表达式为:所述低秩分解矩阵 的表达式为:其中, , 且 ;所述浮点权重矩阵 的表达式为: 。
5.根据权利要求2所述的一种基于强化学习验证奖励的大语言模型日志异常自动检测方法,其特征在于,所述步骤1.5具体包含以下步骤:步骤1.51、首先使用少量经过映射的语义向量,利用低秩适应技术和提示词微调Transformer解码器,使Transformer解码器能够按照格式输出异常提示和正常提示;提示词如下:Below is a sequence of system log messages:<日志内容>、Is this sequencenormal or anomalous?当所述语义向量序列为正常时,大语言模型输出为:The sequenceis normal;当语义向量序列为异常时,大语言模型输出为:The sequence is anomalous;步骤1.52、Transformer解码器模块也按照步骤 1.3 的低秩训练方式进行训练,并与多层感知机模块联合端到端优化,使得Transformer编码器模块、Transformer解码器模块和多层感知机模块均收敛至使异常检测性能最优化的参数配置,确保三个模块能够性能一致,协调工作。
6.根据权利要求2所述的一种基于强化学习验证奖励的大语言模型日志异常自动检测方法,其特征在于,所述步骤1.6具体包含以下步骤:步骤1.61、定义确定性验证器函数,并通过指示函数将是否判对转为 0/1 的确定性奖励用作直接比较预测结果与真实标签;其中,指示函数指的是 0 或 1 的结果函数,将预测结果与真实标签进行比较,相同则为 1,否则为 0;步骤1.62、定义强化学习优化模块中强化学习验证奖励的优化目标函数:其中, 为当前策略, 为当前策略的可学习参数, 为参考策略;r(x,y)对应的是通过指示函数得到的确定性奖励; 表示对输入样本 x 按照数据分布D进行期望/平均; 则是在给定 x 时,当前策略 产生候选输出 y 的随机性求平均; 为 KL散度惩罚, 为 KL 系数,用来控制“对奖励的贪婪”以及“对参考策略的保持”之间的权衡; 为当前策略在输入x上对输出y的概率分布;步骤1.63、采用群体相对策略优化算法进行策略优化;对于每个批次的样本,计算归一化的优势函数:其中, 和 分别为同一个批次或是同一个输入的 k 个候选的奖励的均值和标准差, 为稳定数值项;策略梯度计算公式为:其中, 表示的是用当前策略采样得到的经验分布;步骤1.64、在步骤1.63 的基础之上,引入熵正则项以鼓励探索,按照token计算并且取平均: ,完整的强化学习验证奖励损失函数为:其中, 为熵正则化系数, 为策略熵;步骤1.65、使用Adam优化器更新日志异常自动检测模型参数,学习率采用余弦退火策略:其中,第 t 步的学习率表示为: ,最大、最小学习率分别为: , , 为总训练步数,每一个训练epoch包含以下步骤:从当前策略 采样k个响应;使用验证器计算奖励;计算归一化优势;更新策略参数;周期性更新目标网络。
7.根据权利要求1所述的一种基于强化学习验证奖励的大语言模型日志异常自动检测方法,其特征在于,所述步骤2具体如下:步骤2.1、多种渠道收集待检测系统日志数据,提供原始日志数据源;步骤2.2、使用滑动窗口对待检测的原始日志数据划分序列,得到日志序列;将日志序列输入训练后日志解析器,提取日志模板;步骤2.3、由步骤2.2所得日志模板输入Transformer编码器,提取日志模板的语义向量;步骤2.4、将步骤2.3获得的语义向量输入多层感知机,进行非线性映射,将语义向量的维度从Transformer编码器的输出维度映射为Transformer解码器的输入维度;步骤2.5、经过映射的语义向量序列输入Transformer解码器,利用Transformer解码器的文本生成能力,根据答案模板生成“推理+结论”的候选输出,用于可解释性;步骤 2.6、基于训练好的策略网络进行异常检测,对于输入的候选输出,计算异常概率分布 ,其中, 和 为分类头参数;读取到的判定位置概率对应文本位置得到的 logit向量,计算最后判决结果的概率,当 时判定为异常, 为阈值,输出结果包含异常标签、置信度分数、预测耗时以及推理分析信息;步骤 2.7、通过基于强化学习验证奖励的持续学习机制,待检测系统在运行过程中生成系统日志,并将其定期收集到新的标签日志数据,构建增量训练集;使用与初始训练相同的强化学习验证奖励流程进行增量更新,但采用更小的学习率和更少的训练轮数以避免灾难性遗忘;通过 A/B 测试框架评估新模型相对于当前模型的性能提升,只有当新模型的F1分数提升超过阈值时才进行模型更新。
8.一种基于强化学习验证奖励的大语言模型日志异常自动检测装置,其特征在于,所述装置包括:日志解析器模块,用于从原始日志数据提取日志模板;Transformer编码器模块,用于提取日志模板的语义信息,表达为日志模板的语义向量;多层感知机模块,用于显式维度映射与轻量融合层,将编码器输出语义向量投影到解码器输入所需维度;Transformer 解码器模块,用于对映射后的语义向量进行条件生成,输出“推理过程+判定结论”的自然语言文本,并在判定位置给出可用于分类的概率,从而支撑可解释的异常检测;强化学习优化模块,以确定性验证器产生客观奖励,基于策略梯度对解码策略进行强化学习微调,直接优化“是否异常”的判别与推理一致性;同时以KL约束与熵正则控制策略漂移与探索强度,支持持续学习与增量更新,输出包括异常检测判定、置信度分数以及推理分析信息,与预设阈值比较判定当前日志是否异常;所述Transformer编码器模块、Transformer解码器模块采用低秩训练方式进行训练,并与多层感知机联合端到端优化,使得Transformer编码器模块、Transformer解码器模块和多层感知机模块收敛至使异常检测性能最优化的参数配置。
9.根据权利要求8所述的一种基于强化学习验证奖励的大语言模型日志异常自动检测装置,其特征在于,所述Transformer编码器模块、Transformer解码器模块称为Transformer编解码器模块,其低秩训练方式具体如下:S11、冻结Transformer编解码器模块的原始参数;S12、对Transformer编解码器的原始预训练权重矩阵 进行对称8-bit整数量化,得到的整型权重矩阵 表达式为:其中,缩放因子 ,保留量化参数 用于反量化;round( )函数为就近取整,将缩放之后的实数值对齐到最近的整数网格;clip( )函数通过强制截断将输入值限制在指定范围内,起到数值边界约束的作用,其数学表达式为:S13、在Transformer冻结参数的中间层中添加作用于键矩阵和值矩阵的可训练的低秩分解矩阵 ;其中, , 且 ;S14、反量化原始预训练权重矩阵W并与低秩更新融合,得到的浮点权重矩阵 ,其表达式为:S15、在完成前向反量化融合后,在反向角度,Transformer编解码器通过直通估计器传递量化梯度:其中, 为穿过量化-反量化的不可导路径,传回到量化权重的下游梯度, 则为从损失反向传回到 的上游梯度。
10.根据权利要求8所述的一种基于强化学习验证奖励的大语言模型日志异常自动检测装置,其特征在于,所述强化学习优化模块的处理具体如下:S21、定义确定性验证器函数,并通过指示函数将是否判对转为 0/1 的确定性奖励用作直接比较预测结果与真实标签;其中,指示函数指的是 0 或 1 的结果函数,将预测结果与真实标签进行比较,相同则为 1,否则为 0;S22、定义强化学习优化模块中强化学习验证奖励的优化目标函数:其中, 为当前策略, 为当前策略的可学习参数, 为参考策略;r(x,y)对应的是通过指示函数得到的确定性奖励;而 表示对输入样本 x 按照数据分布D进行期望/平均; 则是在给定 x 时,当前策略 产生候选输出 y 的随机性求平均; 为 KL散度惩罚; 为 KL 系数; 为当前策略在输入x上对输出y的概率分布;S23、在强化学习优化模块中,采用群体相对策略优化算法进行策略优化;对于每个批次的样本,计算归一化的优势函数:其中, 和 分别为同一个批次或是同一个输入的 k 个候选的奖励的均值和标准差, 为稳定数值项;策略梯度计算公式为:其中, 表示的是用当前策略采样得到的经验分布;S24、强化学习优化模块引入熵正则项以鼓励探索,按照 token 计算并且取平均: ,完整的强化学习验证奖励损失函数为:其中, 为熵正则化系数; 为策略熵;S25、强化学习优化模块使用Adam优化器更新日志异常自动检测模型参数,学习率采用余弦退火策略。



