1.一种基于主动学习的多模态大模型迁移微调问答方法,其特征在于,包括以下步骤:S1、输入未标注图像数据集,采用K-Means聚类算法对图像进行分组;S2、对步骤S1得到的每个聚类中抽取预设比例的图像样本,并标注问题-答案对,形成初始视觉问答数据集;S3、使用步骤S2得到的初始视觉问答数据集对预训练的多模态大模型进行初步微调,获得初级微调多模态大模型;S4、基于步骤S3得到的初级微调多模态大模型,计算未标注图像的不确定性指标;所述不确定性指标为熵值、最小置信度及置信区间归一化值的加权和;S5、针对步骤S1得到的每个聚类,选取步骤S4计算得到的不确定性指标最大的未标注图像进行标注;S6、将步骤S5新标注的视觉问答数据与步骤S2获得的初始视觉问答数据集合并,再对步骤S3得到的初级微调多模态大模型进行二次微调;S7、重复执行步骤S4至步骤S6,直到满足预设的迭代终止条件,获得最终迁移的多模态大模型,并通过最终迁移的多模态大模型完成领域的视觉问答任务。
2.如权利要求1所述的一种基于主动学习的多模态大模型迁移微调问答方法,其特征在于,步骤S1的具体过程为:S11、输入大小为 的未标注图像数据集,使用预训练的多模态大模型的视觉编码器V提取每张未标注图像的图像视觉特征 ;其中,i为未标注图像的编号,第i张未标注图像表示为 ,0≤i≤ ;S12、对于大小为 的未标注图像数据集,共有 个图像视觉特征 ,并基于领域知识经验设定聚类数量为k,使用K-Means聚类算法对图像视觉特征 进行聚类分组;S13、迭代优化聚类中心直至收敛,输出分组结果 ,其中, 为前k个分组结果。
3.如权利要求1所述的一种基于主动学习的多模态大模型迁移微调问答方法,其特征在于,步骤S3中,所述初步微调的具体过程为:在训练过程中,设置初始学习率为0.00002,学习率调度器为cosine,学习率预热比例为0.03,训练的全局有效批次大小为64,多模态大模型共训练一轮,得到初级微调多模态大模型。
4.如权利要求1所述的一种基于主动学习的多模态大模型迁移微调问答方法,其特征在于,步骤S4的具体过程为:S41、随机采样N个已标注图像的问题 ,其中,第i个问题表示为 ,0≤i≤N;将采样的问题 与M张未标注图像 进行组合,得到总计 图像-问题对 ;其中, , , ;S42、将 图像-问题对 输入到初级微调多模态大模型,通过视觉编码器提取图像视觉特征 ,再通过文本编码器提取问题语言特征 ;S43、融合图像视觉特征 与问题语言特征 ,获得多模态联合特征 ;S44、基于多模态联合特征 ,初级微调多模态大模型推理输出答案token的概率分布 ;其中,x表示图像问题输入对 ;y表示预测token;S45、计算每个token的熵值,计算公式为: ,其中, 为第 个token的熵值; 为词表中token的索引, ; 为词表大小; 为词表中索引为 的特定token; 为在给定图像-问题对 的条件下,模型预测答案的第 个token为 的概率;S46、计算每个token的最小置信度,计算公式为: ,其中, 为第 个token的最小置信度; (·)表示取最大值; 为在给定图像-问题对 的条件下,模型预测答案的第 个token为词表中任意一个候选 的概率;S47、计算每个token的置信区间,计算公式为: ,其中, 为第 个token的置信区间; 和 分别表示最大概率值和第二大概率值对应的token; 为在给定图像-问题对 的条件下,模型预测答案的第 个token为词表中最大概率 的概率; 为在给定图像-问题对 的条件下,模型预测答案的第 个token为词表中第二大概率 的概率;S48、计算综合不确定性,计算公式为: ,其中, 为综合不确定性; 、 和 分别表示熵值、最小置信度和置信区间的预设权重系数;avg(·)表示取平均值;min(·)表示取最小值;S49、取N个问题综合不确定性的最小值作为图像I的不确定性指标: ,其中, 为图像I的不确定性指标。
5.如权利要求1所述的一种基于主动学习的多模态大模型迁移微调问答方法,其特征在于,步骤S5的具体过程为:S51、对每个聚类中的未标注图像,按其不确定性指标降序排列;S52、选取前M个图像进行标注,其中, ; 为预设采样比例系数; 为预设比例。
6.如权利要求1所述的一种基于主动学习的多模态大模型迁移微调问答方法,其特征在于,步骤S6中,所述二次微调的具体过程为:在训练过程中,设置初始学习率为0.00002,学习率调度器为cosine,学习率预热比例为0.03,训练的全局有效批次大小为64,初级微调多模态大模型共训练 轮,训练轮次 根据具体任务场景进行调整。
7.如权利要求1所述的一种基于主动学习的多模态大模型迁移微调问答方法,其特征在于,步骤S7中的所述迭代终止条件包括以下至少一项:(a)达到预设的最大迭代次数;(b)标注数据总量达到预设阈值;(c)多模态大模型在验证集上的准确率提升幅度小于预设阈值。