1.一种基于大语言模型的岗位人员知识提取方法,其特征在于,所述方法包括:定义和形式化描述知识提取过程中的实体集合、关系集合以及规则约束集;根据所述实体集合、关系集合以及规则约束集构建提示词模板;在所述提示词模板基础上,将获取的简历数据集输入到大模型中通过多轮链式迭代机制输出岗位人员领域三元组集;对所述岗位人员领域三元组集进行知识对齐策略,利用正则表达式进行实体-关系的过滤,根据过滤后的实体与Wikidata数据库的API接口建立跨知识库的实体链接通道进行知识消歧后,获取实体在 Wikidata数据库中的标准名称并计算实体之间的编辑距离;根据所述编辑距离计算实体之间的相似度得分,利用所述相似度得分确定知识对齐结果完成知识抽取。
2.根据权利要求1所述的方法,其特征在于,所述实体集合包含多种数据类型组成的子集,包括岗位集 、人员集 、技能集 和其它实体集;所述关系集合 包含角色关系、技能关系、知识关系、教育关系、工作经验关系、奖项关系以及技能证书关系;所述规则约束集 涵盖了实体关系校验的核心约束条件,包括岗位唯一性规则、技能一致性规则、工作经历时间规则。
3.根据权利要求1所述的方法,其特征在于,所述提示词模板为预先设计好的标准化文本框架,包含任务描述、关系类别及定义、实体类别及定义、规则约束和输出格式示例;所述任务描述表示明确大语言模型需要完成的任务;所述关系类别及定义为对要抽取的各类关系进行定义,说明每种关系的内涵;所述实体类别及定义为明确各类实体的定义来明确要抽取的实体类型;所述输出格式示例规定模型输出的格式。
4.根据权利要求1至3任意一项所述的方法,其特征在于,将获取的简历数据集输入到大模型中通过多轮链式迭代机制输出岗位人员领域三元组集,包括:基于所述提示词模板,对获取的简历数据集进行实体边界识别与基础关系分类和基础语义解析,生成初始结构化数据;将初始结构化数据与本体库的7种关系类型及实体类型进行匹配校验,通过提示词注入本体约束,引导模型识别不符合本体规则的错误生成修正后的数据集;对修正后的数据集通过多轮追问并驱动模型利用上下文语义推断正确信息,生成推断后的数据集,直至达到预先设置的设定迭代终止阈值,输出经过多轮校验的岗位人员领域三元组集。
5.根据权利要求1所述的方法,其特征在于,利用正则表达式进行实体-关系的过滤,包括:输入岗位人员领域三元组集 ,其中,每个三元组 以序号标记开头 ,后接实体-关系-实体结构;构建映射函数 ,通过正则表达式H匹配三元组开头的序号标记子串 ,若匹配到 ,则执行 删除操作;若未匹配,保留原三元组实现对冗余序号标记的精准过滤, 表示执行操作之后得到的三元组集。
6.根据权利要求1所述的方法,其特征在于,计算实体之间的编辑距离为其中, 表示实体 的前 个字符, 表示实体 的前 个字符。
7.根据权利要求1所述的方法,其特征在于,根据所述编辑距离计算实体之间的相似度得分,包括:根据所述编辑距离计算实体之间的相似度得分为其中, 表示计算实体A和B之间的编辑距离, 表示实体 的长度, 表示实体 的长度。
8.根据权利要求1所述的方法,其特征在于,利用所述相似度得分确定知识对齐结果完成知识抽取,包括:当两个实体的相似度得分达到设定的阈值或超过设定的阈值时,将两个实体认定为同一实体,修正拼写变体完成知识抽取。
9.一种基于大语言模型的岗位人员知识提取装置,其特征在于,所述装置包括:多轮链式迭代模块,用于定义和形式化描述知识提取过程中的实体集合、关系集合以及规则约束集;根据所述实体集合、关系集合以及规则约束集构建提示词模板;在所述提示词模板基础上,将获取的简历数据集输入到大模型中通过多轮链式迭代机制输出岗位人员领域三元组集;知识对齐模块,用于对所述岗位人员领域三元组集进行知识对齐策略,利用正则表达式进行实体-关系的过滤,根据过滤后的实体与Wikidata数据库的API接口建立跨知识库的实体链接通道进行知识消歧后,获取实体在 Wikidata数据库中的标准名称并计算实体之间的编辑距离;知识修正模块,用于根据所述编辑距离计算实体之间的相似度得分,利用所述相似度得分确定知识对齐结果完成知识抽取。
10.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至8中任一项所述方法的步骤。