有效
一种基于关系推断的大语言模型日志解析方法和装置
江昊、占鹏、李昊、刘子涵、张逸璇、黄一学
武汉大学
摘要
本发明公开一种基于关系推断的大语言模型日志解析方法,包括:以前缀解析树为核心,对输入日志进行预处理后遍历前缀树实现模板匹配。若匹配成功则输出结构化日志,若未匹配,则从语法和语义双维度评估未匹配日志与其他日志的关系。语法层面计算未匹配日志与候选日志集中语法相似度,语义层面通过LLM评估未匹配日志与历史日志窗口中日志的因果强度及共享实体数量,再结合语义复合评分筛选出语义关联日志;将筛选出的语法相似与语义相关日志作为示例,构造包含任务指令、演示示例及待解析日志的完整提示,调用大语言模型生成未匹配日志的结构化模板;将新生成的模板适配到前缀解析树,通过动态更新完善树结构,为后续日志解析提供更全面的模板支撑。
1.一种基于关系推断的大语言模型日志解析方法,其特征在于,包括:以前缀解析树为核心,对输入日志进行预处理后遍历前缀解析树实现模板匹配,包括:将预处理得到的日志token序列中的token按顺序依次输入前缀解析树进行节点匹配,其中,首个token与根节点的子节点进行匹配,在存在对应的普通token节点或可匹配当前token的通配符节点时,进入当前节点,再用token序列中的下一个token与当前节点的子节点进行匹配,依此循环执行逐token遍历匹配操作;在遍历操作终止时,若当前token无法与内部节点的任何子节点匹配,且未到达叶节点,则判定当前输入日志无法在现有前缀解析树中找到匹配的模板;在未匹配到模板时,从语法和语义双维度推断未匹配日志与候选日志集中日志和历史日志窗口中日志的关系;其中,在语法维度计算未匹配日志与候选日志集中日志的语法相似度,筛选出语法相似日志;在语义维度通过大语言模型推断未匹配日志与历史日志窗口中日志的因果强度及共享实体数量,再结合语义复合评分筛选出语义相关日志;针对未匹配的日志,从语法和语义双维度完成关系推断,筛选高关联演示示例,语法关系推断直接调用离线构建的候选日志集,采用Jaccard系数计算未匹配日志与候选日志的语法相似度:将未匹配日志 与候选日志 分别分词得到token集合 和 ,通过公式: ,计算两者交集元素数量与并集元素数量的比值,最终根据相似度结果筛选出 top-m 个语法相似日志;将筛选出的语法相似日志与语义相关日志作为演示示例,构造包含任务指令、演示示例及待解析日志的完整提示,调用大语言模型生成未匹配日志的结构化模板;将新生成的模板适配到前缀解析树中,动态更新树结构,包括:提取未匹配日志在前缀解析树中终止节点下的所有叶节点,这些叶节点对应的模板构成候选模板集合;接着计算生成的新模板与各候选模板的相似度,采用最长公共子序列长度计算,若相似度超过阈值,说明现有的模板需要调整以适应未匹配日志,将候选模板中对应固定token替换为“<*>”通配符以适配新模板;若相似度均低于阈值,说明没有任何模板能够近似地匹配未匹配日志;在终止节点下新增与新模板 token 序列对应的节点路径,在路径末端添加叶节点存储新模板;完成适配后,前缀解析树覆盖范围扩大,为后续日志解析提供更全面的模板支撑。
2.根据权利要求1所述一种基于关系推断的大语言模型日志解析方法,其特征在于,所述方法还包括:在离线阶段,通过对历史系统日志进行聚类及分层抽样,构建候选日志集。
3.根据权利要求1所述一种基于关系推断的大语言模型日志解析方法,其特征在于,所述前缀解析树由根节点、内部节点及叶节点构成:所述根节点为日志解析起始点;所述内部节点包括代表常量的普通token节点以及用于匹配任意token通配符节点;所述叶节点唯一对应一条已存储的日志模板,从根节点到叶节点的路径token串联形成完整日志模板字符串。
4.根据权利要求1所述一种基于关系推断的大语言模型日志解析方法,其特征在于,在遍历过程中,若能够到达某一个叶节点,则表明当前输入日志成功匹配到该叶节点对应的模板。
5.根据权利要求1所述一种基于关系推断的大语言模型日志解析方法,其特征在于,所述构造包含任务指令、演示示例及待解析日志的完整提示,包括:基于上下文学习构造提示词,所述提示词遵循“任务指令-演示示例-查询”结构:首先明确任务指令;随后将筛选出的语法相似日志与语义相关日志,按“日志示例-对应结构化模板”的成对形式组织为演示示例;最后将未匹配日志作为查询,嵌入提示末尾。
6.一种基于关系推断的大语言模型日志解析装置,其特征在于,包括:前缀解析树解析模块,用于以前缀解析树为核心,对输入日志进行预处理后遍历前缀解析树实现模板匹配,包括:将预处理得到的日志token序列中的token按顺序依次输入前缀解析树进行节点匹配,其中,首个token与根节点的子节点进行匹配,在存在对应的普通token节点或可匹配当前token的通配符节点时,进入当前节点,再用token序列中的下一个token与当前节点的子节点进行匹配,依此循环执行逐token遍历匹配操作;在遍历操作终止时,若当前token无法与内部节点的任何子节点匹配,且未到达叶节点,则判定当前输入日志无法在现有前缀解析树中找到匹配的模板;日志关系推断模块,用于在未匹配到模板时,从语法和语义双维度推断未匹配日志与候选日志集中日志和历史日志窗口中日志的关系;其中,在语法维度计算未匹配日志与候选日志集中日志的语法相似度,筛选出语法相似日志;在语义维度通过大语言模型推断未匹配日志与历史日志窗口中日志的因果强度及共享实体数量,再结合语义复合评分筛选出语义相关日志;针对未匹配的日志,从语法和语义双维度完成关系推断,筛选高关联演示示例,语法关系推断直接调用离线构建的候选日志集,采用Jaccard系数计算未匹配日志与候选日志的语法相似度:将未匹配日志 与候选日志 分别分词得到token集合 和 ,通过公式: ,计算两者交集元素数量与并集元素数量的比值,最终根据相似度结果筛选出 top-m 个语法相似日志;日志模板生成模块,用于将筛选出的语法相似日志与语义相关日志作为演示示例,构造包含任务指令、演示示例及待解析日志的完整提示,调用大语言模型生成未匹配日志的结构化模板;前缀解析树树更新模块,用于将新生成的模板适配到前缀解析树中,动态更新树结构,包括:提取未匹配日志在前缀解析树中终止节点下的所有叶节点,这些叶节点对应的模板构成候选模板集合;接着计算生成的新模板与各候选模板的相似度,采用最长公共子序列长度计算,若相似度超过阈值,说明现有的模板需要调整以适应未匹配日志,将候选模板中对应固定token替换为“<*>”通配符以适配新模板;若相似度均低于阈值,说明没有任何模板能够近似地匹配未匹配日志;在终止节点下新增与新模板 token 序列对应的节点路径,在路径末端添加叶节点存储新模板;完成适配后,前缀解析树覆盖范围扩大,为后续日志解析提供更全面的模板支撑。
7.一种计算设备,其特征在于,包括:处理器、存储器、通信接口和通信总线,所述处理器、所述存储器和所述通信接口通过所述通信总线完成相互间的通信;所述存储器用于存放至少一可执行指令,所述可执行指令使所述处理器执行如权利要求1-5中任一项所述的一种基于关系推断的大语言模型日志解析方法的步骤。
8.一种计算机存储介质,其特征在于,所述存储介质中存储有至少一可执行指令,所述可执行指令使处理器执行如权利要求1-5中任一项所述的一种基于关系推断的大语言模型日志解析方法的步骤。



