1.基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,包括以下步骤:获取遥感图像;给定校准数据集 和视觉编码器 ,其中 ,N为视觉编码器的层数, 为视觉编码器的权重, 为视觉输入, 为语言输入,T是数据集中数据的数量,利用预训练的Q-Former,将图像中每个块的编码视觉信息转换为具有语言信息的视觉表示;基于每个块的输出,将不同模态中功能相似的层进行分组;引入KL散度作为辅助目标支持参数重要性估计;计算模态协同重要性分数,将模态协同重要性分数分配给同组内的所有权重;获得每层中各权重的重要性分数后,计算每个权重的稀疏度;在层稀疏度 和校准数据集 的基础上,找到能最大限度保持模型性能的最优稀疏权重 ;根据层稀疏度 和 执行视觉语言大模型的分层剪枝;剪枝后的视觉语言大模型进行图像分割,并输出图像分割结果。
2.根据权利要求1所述的基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,所述最优稀疏权重 计算如下:其中 为计算权重矩阵中每个参数的重要性分数的函数, 表示 剪枝后的权重,为第i层的稀疏权重, 是全容量模型第 层的权重, 表示第 层的局部目标, 表示第 层的目标稀疏度。
3.根据权利要求2所述的基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,基于Q-Former的视觉语言层分组利用预训练的Q-Former,将每个块中的编码视觉信息转换为具有语言信息的视觉表示,包括:其中 表示视觉块 的编码视觉表示, 表示视觉块 的编码视觉表示,权重为 ,且 , 是语言块 的编码语言表示, 是语言块 的编码语言表示,权重为 ,且 是具有权重 的Q-Former,用于从视觉块 的每个输出中提取视觉信息并将其转化为具有语言信息的表示 。
4.根据权利要求3所述的基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,所述基于每个块的输出,将不同模态中功能相似的层进行分组,包括:给定从视觉子模型块输出中提取的具有语言信息的表示集 和语言子模型块的编码语言表示集 ,引入交叉注意力来衡量不同模态编码表示的相关性,从而根据编码表示的交叉注意力得分对不同模态的层进行分组:其中 表示视觉语言大模型中视觉和语言子模型层之间的相关性矩阵, 表示视觉子模型块 和语言子模型块 的相关性得分, 是分组集合,其中 表示第 组层, ,M是语言编码器的层数,对于从 到 的 ,将视觉子模型的第 块与其最相关的块 匹配,其中 且 ,对于未匹配的块,将每个块中的层单独分组,并将其标记为从 到 。
5.根据权利要求4所述的基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,为在模型压缩过程中提供参数重要性估计,首先将给定预训练数据集 的样本划分为多个簇,即 ;随后,对每个簇 进行排序,并选择离中心最近的数据点 作为代表样本,组成多视角校准数据集 。
6.根据权利要求5所述的基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,在获得多视角校准数据集 后,提取原始模型的输出概率分布作为软标签,以此捕捉模型在各领域的全面知识。
7.根据权利要求6所述的基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,所述的引入KL散度作为辅助目标支持参数重要性估计,包括:给定全容量模型的权重 ,其中 为第 层的权重,通过计算针对视觉语言大模型全局目标 和一致性目标 的零阶近似梯度来估计权重 的重要性。
8.根据权利要求7所述的基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,为实现视觉语言大模型的模态协同剪枝,通过三种方式计算模态协同重要性分数:乘积: ,求和: ,最大化: ; 是权重W的重要性分数, 表示第 组层;随后,将模态协同重要性分数分配给同组内的所有权重: 。
9.根据权利要求8所述的基于模态协同视觉语言大模型分层剪枝的图像分割方法,其特征在于,在获得每层中各权重的重要性分数后,计算每个权重的稀疏度:其中 为全容量模型的目标稀疏度, 是第j层的权重,|W|是参数个数, 为根据 的重要性分数计算的保留参数数目,最终,得到每层 的稀疏度 。