1.基于分区层次图的海量高维数据学习索引构建方法,其特征在于,包括:确定数据集和聚类分区个数;所述聚类分区个数确定步骤包括:选择聚类分区数量的范围;对聚类分区数量范围内的每个值运行k-means*算法,并计算对应的畸变程度avgSSE;将每个值对应的畸变程度avgSSE绘制成图标,利用“肘部法”对畸变程度聚类进行评估,进而确定聚类分区个数;基于数据集和聚类分区个数,利用k-means*算法对数据集中的数据进行分区;所述k-means*算法的步骤包括:遍历数据集X中的每一个数据点 ,计算数据点 到每个质心的距离并进行比较得到最小距离 ,并将与数据点 距离最短的质心所在的片区记为分区 ;计算数据点 到每个质心的距离 与最小距离 的差值,记为 ;若距离 小于阈值 ,则证明数据点 为分区 与分区j的边界数据,则将数据点同时分配给分区 与分区j;若距离 大于等于阈值 ,则证明数据点 不在各个分区的边界上,则将数据点 分配给分区 ;当数据集中所有的数据点分区完成后,利用并行计算框架在每个分区中同时构建HNSW图,得到分区相似性图索引结构;基于分区相似性图索引结构,利用邻近查询方法对海量高维数据进行查询。
2.根据权利要求1所述的基于分区层次图的海量高维数据学习索引构建方法,其特征在于,所述邻近查询方法步骤为:输入一个查询点 与近邻个数 ;比较 与各个分区质心的距离,并选择距离 最近的分区作为索引子分区 ;将查询 与近邻个数 输入索引子分区 中的HNSW索引结构,并在索引子分区 中的HNSW索引中输出最终索引结果。