1.一种基于强化学习微调语义向量模型的专利主题聚类方法,其特征在于,包括如下步骤:步骤1、获取相关领域内专利文本集,提取结构化文本信息和非结构化文本信息;步骤2、初始化关键参数;步骤3、对结构化文本信息进行向量化处理;步骤4、基于BGE语义向量模型对非结构化专利文本信息进行向量化处理;步骤5、特征融合并计算整体专利文本集的特征均值向量;步骤6、基于K-means聚类算法对专利文本集进行专利主题聚类;步骤7、计算聚类结果的评价指标邓恩指标 I dunn ;步骤8、基于强化学习中的PG定理计算关键参数导数,并更新关键参数,判断循环跳出条件,若不满足,则返回步骤3,否则跳出循环;步骤9、基于最新关键参数,计算并输出聚类结果;步骤2中所述的初始化关键参数包括初始化嵌入矩阵 和 、BGE语义向量模型中的神经网络权重参数向量 、K-means聚类算法中产生参数 的策略神经网络的权重参数向量 和 ,其中, 、 、 和 通过随机设置获得, 使用已经开源的预训练通用参数;步骤3中所述的对结构化文本信息进行向量化处理,包括如下步骤:步骤3-1、将专利文本集合中所有出现过的申请人整合成一个申请人汇总表,所有出现过的发明人整合成一个发明人汇总表;步骤3-2、为专利文本集合中的每一篇专利进行申请人向量编码和发明人向量编码,获得申请人向量 和发明人向量 ;步骤3-3、基于申请人向量 和发明人向量 计算申请人嵌入向量 和发明人嵌入向量 ,计算方式如下: ,其中, i 表示专利文本集中的专利索引, 为r行n列的嵌入矩阵, 为r行m列的嵌入矩阵, 和 两个矩阵中的参数会在迭代计算中不断更新变化,初始化时通过随机设置获得,参数r为人工预设;步骤4中所述的基于BGE语义向量模型对非结构化专利文本信息进行向量化处理包括:将专利文本集合中第 篇专利的非结构化信息记作 ,将 输入至BGE语义向量模型,获得非结构化信息特征向量 ,计算过程表示如下: ,其中, 是一个关于权重参数向量 的神经网络模型,通过输入专利文本的摘要内容能够输出特征向量,该神经网络模型中的参数向量 会在迭代计算中不断更新变化;步骤6中所述的基于K-means聚类算法对专利文本集进行专利主题聚类,包括:步骤6-1、根据策略设置K-means聚类算法中的参数 ;步骤6-2、随机设置 个中心点 ;步骤6-1所述的根据策略设置K-means聚类算法中的参数 包括: ,其中, 是一个关于权重参数向量 和 的策略神经网络模型,通过输入所有专利融合后的特征均值向量 能够实现输出一个离散概率分布,再根据该离散概率分布得到参数 及其对应的离散概率 ,该神经网络模型中的参数向量 和 会在迭代计算中不断更新变化;步骤8中所述的基于强化学习中的PG定理计算关键参数导数,计算方式如下: ,其中, 为关键参数 、 、 、 和 中的任意一个, 表示求关于关键参数 的导数, 表示对中括号中的内容求期望值,对 , 是采样 的概率密度, 是获得参数 时的离散概率;步骤8中所述的更新关键参数,方式如下: ,其中, 表示更新后的关键参数值, 表示更新前的关键参数值, 为关键参数 、 、 、 和 中的任意一个, 为学习率, 在循环迭代计算中以固定模式递减。
2.根据权利要求1所述的一种基于强化学习微调语义向量模型的专利主题聚类方法,其特征在于,步骤1中所述的结构化文本信息包括专利文本中的申请人信息和发明人信息,所述的非结构化文本信息包括专利文本中的摘要内容。
3.根据权利要求2所述的一种基于强化学习微调语义向量模型的专利主题聚类方法,其特征在于,步骤5中所述的特征融合并计算整体专利文本集的特征均值向量,包括如下步骤:步骤5-1、将专利文本集合中每一篇专利的结构化和非结构化文本信息向量化后的结果进行向量拼接,假设专利文本集合中第 篇专利拼接后的向量为 ,拼接方式如下: ,步骤5-2、以 为均值向量, 为协方差,构造正态分布,并进行采样得到特征向量 ,同时计算得到采样该 的概率密度 ,其中 为预设参数,记 是 行的列向量,第 行的元素记作 , ;步骤5-3、计算整体专利文本集的特征均值向量 ,将 第 行的元素记作 , 中任意一行元素 的计算方式如下: ,其中, 是专利文本集中专利文本的总数。
4.根据权利要求3所述的一种基于强化学习微调语义向量模型的专利主题聚类方法,其特征在于,步骤6中所述的基于K-means聚类算法对专利文本集进行专利主题聚类,还包括如下步骤:步骤6-3、计算每个专利的特征向量 到每个中心点 的欧式距离 ;步骤6-4、将每个专利分配到对应的类簇中;步骤6-5、重新计算 个中心点 ;步骤6-6、重复步骤6-3至步骤6-5,直到预设的最大迭代次数为止。
5.根据权利要求4所述的一种基于强化学习微调语义向量模型的专利主题聚类方法,其特征在于,步骤7中所述的评价指标邓恩指标 ,计算如下: ,其中, 表示任意两类簇 和 的远离程度,计算方式为分别在两个类簇 和 中各取一个样本点 和 ,计算欧式距离 ,取最小的欧式距离作为这两个类簇之间的远离程度; 表示任意一个类簇 的覆盖直径,计算方式为取类簇 内任意两个样本点 和 ,计算欧式距离 ,取最大的欧式距离作为这个类簇 的覆盖直径。