1.一种基于跨模态信息补全的零样本文本分类方法,其特征在于,所述方法包括:获取文本样本集和标签对应的图像候选集;计算标签对应的图像与相应文本样本之间的余弦相似度并取均值,根据得到的平均余弦相似度,确定每个标签的映射图像候选集;根据每个标签的映射图像候选集在验证集上的表现,选择表现最优的图像作为该标签的最佳映射图像;将各标签对应的训练集样本输入到大规模预训练语言模型,生成预设数量个候选关键词短语,构成关键词候选集;根据所述关键词候选集、标签映射图像、文本样本、标签集进行多模态匹配与选择,得到与领域适配的最佳关键词;根据每个标签的所述最佳映射图像和所述与领域适配的最佳关键词,进行文本语义增强的图像标注,得到跨模态信息补全的图像;对测试样本集和所述跨模态信息补全的图像采用双路径增强策略处理后通过CLIP模型进行零样本推理,得到文本分类结果。
2.根据权利要求1所述基于跨模态信息补全的零样本文本分类方法,其特征在于,计算标签对应的图像与相应文本样本之间的余弦相似度并取均值,根据得到的平均余弦相似度,确定每个标签的映射图像候选集,包括:采用CLIP模型的图像编码器和文本编码器分别对标签对应的图像与相应文本样本进行图像编码和文本编码并归一化,得到归一化文本编码和归一化图像编码;根据所述归一化文本编码和所述归一化图像编码采用余弦相似度计算每个候选图像和所有文本样本之间的相似度,并取平均值,得到每个候选图像的平均余弦相似度;对于每一个标签,根据所述平均余弦相似度从对应的图像候选集中选择排名前5的候选图像作为该标签的映射图像候选集。
3.根据权利要求1所述基于跨模态信息补全的零样本文本分类方法,其特征在于,将各标签对应的训练集样本输入到大规模预训练语言模型,生成预设数量个候选关键词短语,构成关键词候选集,包括:将每个标签对应的训练集样本输入到GPT-4o大规模预训练语言模型,根据用户的提示指令,生成一组相关的关键词短语,构成关键词候选集。
4.根据权利要求1所述基于跨模态信息补全的零样本文本分类方法,其特征在于,根据所述关键词候选集、标签映射图像、文本样本、标签集进行多模态匹配与选择,得到与领域适配的最佳关键词,包括:对标签映射图像、标签、文本样本以及所述关键词候选集中的关键词进行特征提取,得到图像特征编码、标签特征编码、文本样本特征融合以及关键词特征编码;分别计算关键词与标签映射图像、标签以及文本样本的余弦相似度,得到关键词图像语义相似度、关键词标签语义相似度以及关键词文本样本语义相似度;将关键词图像语义相似度、关键词标签语义相似度以及关键词文本样本语义相似度进行加权求和,得到综合加权评分函数;根据所述综合加权评分函数采用最优关键词决策,得到与领域适配的最佳关键词。
5.根据权利要求1所述基于跨模态信息补全的零样本文本分类方法,其特征在于,根据每个标签的所述最佳映射图像和所述与领域适配的最佳关键词,进行文本语义增强的图像标注,得到跨模态信息补全的图像,包括:根据自适应位置标注选择方法确定所述与领域适配的最佳关键词在对应最佳映射图像上的最佳位置映射;在验证集上对不同字体大小的性能表现进行定量评估与对比分析,确定所述与领域适配的最佳关键词的最优字体参数配置;根据所述与领域适配的最佳关键词的最佳位置映射和最优字体参数配置,完成对图像标注,得到跨模态信息补全的图像。
6.根据权利要求5所述基于跨模态信息补全的零样本文本分类方法,其特征在于,所述自适应位置标注选择方法的具体步骤包括:采用CLIP模型进行文本和图像特征编码,并进行归一化后处理,得到文本特征矩阵和图像特征向量;根据所述图像特征向量和所述文本特征矩阵,计算图像与所有文本的余弦相似度,并取其平均值,得到最终评估指标;根据所述最终评估指标和评估不同预设位置的标注效果,选择使标注图像与文本样本集合的语义一致性最高的位置作为文本在图像上的最佳位置映射。
7.根据权利要求5所述基于跨模态信息补全的零样本文本分类方法,其特征在于,所述最佳位置映射为:其中, 表示类别标签集合到预设位置集合的最佳位置映射, 表示标签, 表示在图像 上以位置 p 标注关键词 的过程, 表示文本样本集合, 表示最终评估指标。
8.根据权利要求5所述基于跨模态信息补全的零样本文本分类方法,其特征在于,在验证集上对不同字体大小的性能表现进行定量评估与对比分析,确定所述与领域适配的最佳关键词的最优字体参数配置,包括:设计动态字体大小调整的目标函数和约束条件为:其中, 为目标函数, 表示字体大小, , 和 表示文本宽度和高度, t 表示待标注的文本内容, W , H 表示图像尺寸;当启用动态调整时,则基于所述约束条件进行优化选择最合适的字体大小作为所述与领域适配的最佳关键词的最优字体参数配置;如果通过交叉验证集对模型性能进行量化评估,若动态调整后模型的推理性能仍未显著改善,则选择手动调整字体大小,确定所述与领域适配的最佳关键词的最优字体参数配置。
9.一种基于跨模态信息补全的零样本文本分类装置,其特征在于,所述装置包括:文本和标签图像获取模块,用于获取文本样本集和标签对应的图像候选集;标签的映射图像候选集构建模块,用于计算标签对应的图像与相应文本样本之间的余弦相似度并取均值,根据得到的平均余弦相似度,确定每个标签的映射图像候选集;跨模态信息补全的图像生成模块,用于根据每个标签的映射图像候选集在验证集上的表现,选择表现最优的图像作为该标签的最佳映射图像;将各标签对应的训练集样本输入到大规模预训练语言模型,生成预设数量个候选关键词短语,构成关键词候选集;根据所述关键词候选集、标签映射图像、文本样本、标签集进行多模态匹配与选择,得到与领域适配的最佳关键词;根据每个标签的所述最佳映射图像和所述与领域适配的最佳关键词,进行文本语义增强的图像标注,得到跨模态信息补全的图像;文本分类模块,用于对测试样本集和所述跨模态信息补全的图像采用双路径增强策略处理后通过CLIP模型进行零样本推理,得到文本分类结果。