1.一种基于工作说明书解析的岗位画像标签提取方法,其特征在于,所述方法包括:获取相关企业岗位的工作说明书;对所述工作说明书进行预处理,得到预处理后的工作说明书;根据自然语言处理技术对所述预处理后的工作说明书进行向量化处理,得到向量化后的工作说明书;对所述向量化后的工作说明书中的关键词进行模糊计算,得到关键词的模糊因子;利用所述模糊因子设置模糊聚类的损失函数,根据所述损失函数对所述关键词进行分配,得到每个关键词所属的初始类别;根据基于密度的DBSCAN算法对分配初始类别后的关键词进行密度聚类,得到每个类别的中心以及中心对应的关键词集合;将所述关键词集合作为岗位的画像标签;对所述向量化后的工作说明书中的关键词进行模糊计算,得到关键词的模糊因子,包括:对所述向量化后的工作说明书中的关键词进行模糊计算,得到关键词的模糊因子为 ,其中, 表示关键词 到第 j 个类别中心 的距离, 表示关键词 到第 k 个类别中心 的距离, m 表示类别总数, b 是模糊因子的指数;利用所述模糊因子设置模糊聚类的损失函数,包括:利用所述模糊因子设置模糊聚类的损失函数为 = ,其中, n 表示关键词总数。
2.根据权利要求1所述的方法,其特征在于,对所述工作说明书进行预处理,得到预处理后的工作说明书,包括:对所述工作说明书进行文本清洗,去除工作说明书中的无用信息,再根据jieba分词工具对清洗后的工作说明书进行分词和词性标注并进行停用词过滤,得到预处理后的工作说明书。
3.根据权利要求1所述的方法,其特征在于,根据自然语言处理技术对所述预处理后的工作说明书进行向量化处理,得到向量化后的工作说明书,包括:根据TF-IDF算法对所述预处理后的工作说明书进行关键词提取,再根据词袋模型对提取后的句子或短语进行向量化,得到向量化后的句子;对所有向量化后的句子进行加权平均,得到向量化后的工作说明书。
4.根据权利要求3所述的方法,其特征在于,根据TF-IDF算法对所述预处理后的工作说明书进行关键词提取,包括:根据TF-IDF算法对所述预处理后的工作说明书进行关键词提取,得到提取后的句子或短语为 ,其中,w表示单词, 表示工作说明书文本中的一个句子或短语,D表示整篇工作说明书, 表示单词w在句子或短语 中的出现频率, 表示单词w在整篇工作说明书中的逆文档频率。
5.根据权利要求1所述的方法,其特征在于,根据基于密度的DBSCAN算法对分配初始类别后的关键词进行密度聚类,得到每个类别对应的关键词集合,包括:将分配初始类别后的关键词分为核心点、边界点和噪声点;所述核心点是指在以自身为圆心,ϵ为半径的邻域内至少包含 个点的数据点,其中 是一个预设的参数;所述边界点是指在以核心点为圆心,ϵ为半径的邻域内但不是核心点的数据点;所述噪声点是指既不是核心点也不是边界点的数据点;随机选择一个的关键词 x ,判断其是否为核心点,如果是核心点,则创建一个新的簇,并将所述核心点以及其密度可达的所有点归为新的簇;如果 x 不是核心点,但是 x 是某个核心点的边界点,则将 x 归为对应核心点所在的簇;如果 x 既不是核心点也不是边界点,则将 x 标记为噪声点,直到所有关键词都被分类为止,得到每个类别对应的关键词集合;其中,对于每个关键词 ,定义以其为圆心, 为半径的邻域为 ,如果某个关键词 在关键词 的邻域内,即 ,则称 是 的直接密度可达点,如果存在一个关键词序列 ,其中, ,满足 ,且 是 的直接密度可达点,则称 是 的密度可达点。
6.一种基于工作说明书解析的岗位画像标签提取装置,其特征在于,所述装置包括:预处理模块,用于获取相关企业岗位的工作说明书;对所述工作说明书进行预处理,得到预处理后的工作说明书;向量化处理模块,用于根据自然语言处理技术对所述预处理后的工作说明书进行向量化处理,得到向量化后的工作说明书;模糊聚类模块,用于对所述向量化后的工作说明书中的关键词进行模糊计算,得到关键词的模糊因子;利用所述模糊因子设置模糊聚类的损失函数,根据所述损失函数对所述关键词进行分配,得到每个关键词所属的初始类别;密度聚类模块,用于根据基于密度的DBSCAN算法对分配初始类别后的关键词进行密度聚类,得到每个类别的中心以及中心对应的关键词集合;将所述关键词集合作为岗位的画像标签;模糊聚类模块还用于对所述向量化后的工作说明书中的关键词进行模糊计算,得到关键词的模糊因子,包括:对所述向量化后的工作说明书中的关键词进行模糊计算,得到关键词的模糊因子为 ,其中, 表示关键词 到第 j 个类别中心 的距离, 表示关键词 到第 k 个类别中心 的距离, m 表示类别总数, b 是模糊因子的指数;利用所述模糊因子设置模糊聚类的损失函数,包括:利用所述模糊因子设置模糊聚类的损失函数为 = ,其中, n 表示关键词总数。