有效
基于两级聚类的文档智能处理方法、装置、设备及介质
闫永强、尹东富、侯皓文、林钊、施斯、冷健、董淳光
人工智能与数字经济广东省实验室(深圳)
摘要
本申请涉及基于两级聚类的文档智能处理技术领域,揭示了一种基于两级聚类的文档智能处理方法、装置、设备及介质,其中,方法包括:通过对章节标题进行密度聚类,能够自动、高效地发现文档集的宏观主题结构,动态确定第一聚类中心数量,从根本上克服了传统K‑Means等方法需人工预设K值的盲目性,其次,利用第一聚类中心数量确定第二聚类中心数量,指导内容聚类。本发明的有益效果:既显著降低了直接对高维全文进行密度聚类的巨大计算开销,又通过标题主题与内容细节的语义互补,实现了层次化的文档理解,最后基于内容聚类构建的向量索引,为大规模文档的精准、高效语义检索与分析奠定了坚实基础。
1.一种基于两级聚类的文档智能处理方法,其特征在于,所述方法包括:获取待处理文档集合中各个待处理文档的章节标题;其中,所述待处理文档集合包括多个待处理文档;基于各个所述待处理文档的章节标题进行章节密度聚类,得到章节密度聚类结果;根据所述章节密度聚类结果确定所述待处理文档集合的第一聚类中心数量;其中,确定所述第一聚类中心数量的方式为:根据所述章节密度聚类结果通过Elbow法的肘部点作为初候选K值,并利用轮廓系数与Davies-Bouldin指数来验证,得到第一聚类中心数量;根据所述第一聚类中心数量确定第二聚类中心数量;获取各个所述待处理文档的文档内容,并基于所述第二聚类中心数量进行内容聚类,得到内容聚类结果;根据所述内容聚类结果构建所述待处理文档集合的向量相似度索引,得到检索数据库;所述基于各个所述待处理文档的章节标题进行章节密度聚类,得到章节密度聚类结果的步骤,包括:预处理各个所述待处理文档的章节标题;其中,所述预处理包括移除格式字符、截取编号后有效文本、过滤无效标题及限制重复标题数量;使用预训练的嵌入模型将预处理后的章节标题文本转化为语义向量,并对所述语义向量进行归一化处理;使用层次密度聚类算法对归一化后的语义向量进行聚类,并对聚类结果中的离群点进行置信度判定与重新分配,得到章节密度聚类结果;所述根据所述内容聚类结果构建所述待处理文档集合的向量相似度索引,得到检索数据库的步骤之后,还包括:获取新输入文本;将所述新输入文本进行向量化处理,得到目标文本向量;基于所述目标文本向量与所述检索数据库中各内容簇中心向量的相似度,确定所述目标文本向量的主归属簇;基于所述主归属簇执行多级相似文档检索,得到检索结果;根据所述检索结果判断所述新输入文本是否与所述检索数据库中的待处理文档发生冲突;若存在至少一个文档向量与目标文本向量的相似度超过预设的冲突阈值,则判定新输入文本与检索数据库中的待处理文档发生冲突;否则,判定为不冲突,如果冲突则拒绝添加新文本;所述基于所述主归属簇执行多级相似文档检索,得到检索结果的步骤,包括:计算所述目标文本向量与所述主归属簇内各个待处理文档对应的文档向量的第一相似度,将第一相似度大于第一相似度阈值的待处理文档进行集合,得到第一相似文档集合;计算所述目标文本向量与其他各个非主归属簇聚类中心对应中心向量的第二相似度,根据各个所述第二相似度对各个非主归属簇进行排序,得到排序结果;根据所述排序结果依次在各所述非主归属簇中计算所述目标文本向量与各个非主归属簇内文档向量的第三相似度,将第三相似度大于第二相似度阈值的待处理文档进行集合,得到第二相似文档集合;基于所述第一相似文档集合与所述第二相似文档集合,确定最终相似文档检索结果;基于所述最终相似文档检索结果中各个待处理文档与所述目标文本向量的相似度,执行分级语义分析;所述基于所述最终相似文档检索结果中各个待处理文档与所述目标文本向量的相似度,执行分级语义分析的步骤,包括:根据预设的多个相似度阈值区间,对所述最终相似文档检索结果中的各个待处理文档进行分类;其中,所述多个相似度阈值区间包括指定阈值区间和非指定阈值区间;将指定阈值区间内的待处理文档与所述目标文本向量输入预设的大语言模型进行深度语义冲突检测;根据检测结果执行语义分析。
2.根据权利要求1所述的基于两级聚类的文档智能处理方法,其特征在于,所述获取各个所述待处理文档的文档内容,并基于所述第二聚类中心数量进行内容聚类,得到内容聚类结果的步骤,包括:获取所述待处理文档集合中各待处理文档的文档内容;将各个文档内容进行向量化处理,得到文档内容语义向量;采用K-Means算法以第二聚类中心数量为聚类中心数量,对各个所述文档内容语义向量进行聚类,得到第二聚类中心数量的内容簇及每个内容簇的中心向量,从而得到内容聚类结果。
3.根据权利要求2所述的基于两级聚类的文档智能处理方法,其特征在于,所述将各个文档内容进行向量化处理,得到文档内容语义向量的步骤之前,还包括:计算每个文档内容的文档哈希值;根据各个文档哈希值判断是否存在重复的文档内容;对重复的文档内容进行去重处理,以对去重后的文档内容进行向量化处理。
4.一种基于两级聚类的文档智能处理装置,其特征在于,所述装置包括:第一获取模块,用于获取待处理文档集合中各个待处理文档的章节标题;其中,所述待处理文档集合包括多个待处理文档;聚类模块,用于基于各个所述待处理文档的章节标题进行章节密度聚类,得到章节密度聚类结果;第一确定模块,用于根据所述章节密度聚类结果确定所述待处理文档集合的第一聚类中心数量;其中,确定所述第一聚类中心数量的方式为:根据所述章节密度聚类结果通过Elbow法的肘部点作为初候选K值,并利用轮廓系数与Davies-Bouldin指数来验证,得到第一聚类中心数量;第二确定模块,用于根据所述第一聚类中心数量确定第二聚类中心数量;第二获取模块,用于获取各个所述待处理文档的文档内容,并基于所述第二聚类中心数量进行内容聚类,得到内容聚类结果;构建模块,用于根据所述内容聚类结果构建所述待处理文档集合的向量相似度索引,得到检索数据库;所述聚类模块,包括:预处理子模块,用于预处理各个所述待处理文档的章节标题;其中,所述预处理包括移除格式字符、截取编号后有效文本、过滤无效标题及限制重复标题数量;文本转化子模块,用于使用预训练的嵌入模型将预处理后的章节标题文本转化为语义向量,并对所述语义向量进行归一化处理;聚类子模块,用于使用层次密度聚类算法对归一化后的语义向量进行聚类,并对聚类结果中的离群点进行置信度判定与重新分配,得到章节密度聚类结果;新输入文本获取模块,用于获取新输入文本;向量化模块,用于将所述新输入文本进行向量化处理,得到目标文本向量;主归属簇确定模块,用于基于所述目标文本向量与所述检索数据库中各内容簇中心向量的相似度,确定所述目标文本向量的主归属簇;多级相似文档检索模块,用于基于所述主归属簇执行多级相似文档检索,得到检索结果;冲突判断模块,用于根据所述检索结果判断所述新输入文本是否与所述检索数据库中的待处理文档发生冲突;若存在至少一个文档向量与目标文本向量的相似度超过预设的冲突阈值,则判定新输入文本与检索数据库中的待处理文档发生冲突;否则,判定为不冲突,如果冲突则拒绝添加新文本;所述多级相似文档检索模块,包括:第一相似度计算子模块,用于计算所述目标文本向量与所述主归属簇内各个待处理文档对应的文档向量的第一相似度,将第一相似度大于第一相似度阈值的待处理文档进行集合,得到第一相似文档集合;第二相似度计算子模块,用于计算所述目标文本向量与其他各个非主归属簇聚类中心对应中心向量的第二相似度,根据各个所述第二相似度对各个非主归属簇进行排序,得到排序结果;第三相似度计算子模块,用于根据所述排序结果依次在各所述非主归属簇中计算所述目标文本向量与各个非主归属簇内文档向量的第三相似度,将第三相似度大于第二相似度阈值的待处理文档进行集合,得到第二相似文档集合;最终相似文档检索结果确定子模块,用于基于所述第一相似文档集合与所述第二相似文档集合,确定最终相似文档检索结果;分级语义分析子模块,用于基于所述最终相似文档检索结果中各个待处理文档与所述目标文本向量的相似度,执行分级语义分析;所述分级语义分析子模块,包括:分类单元,用于根据预设的多个相似度阈值区间,对所述最终相似文档检索结果中的各个待处理文档进行分类;其中,所述多个相似度阈值区间包括指定阈值区间和非指定阈值区间;深度语义冲突检测单元,用于将指定阈值区间内的待处理文档与所述目标文本向量输入预设的大语言模型进行深度语义冲突检测;语义分析单元,用于根据检测结果执行语义分析。
5.一种计算机可读存储介质,其特征在于,存储有计算机程序,所述计算机程序被处理器执行时,使得所述处理器执行如权利要求1至3中任一项所述基于两级聚类的文档智能处理方法的步骤。
6.一种电子设备,其特征在于,所述设备包括存储器和处理器,所述存储器存储有计算机程序,所述计算机程序被所述处理器执行时,使得所述处理器执行如权利要求1至3中任一项所述基于两级聚类的文档智能处理方法的步骤。



