有效
一种面向轨道交通的视觉大模型高效微调及语义分割方法
林椿眄、田大新、王尧、段续庭、周建山
北京航空航天大学
摘要
本申请公开了一种面向轨道交通的视觉大模型高效微调及语义分割方法,涉及人工智能深度学习领域中的图像特征处理、视觉大模型微调及语义分割领域,该方法构建轨道运行环境语义分割数据集,并利用轨道运行环境语义分割数据集训练视觉大模型;通过掩码自编码器提取轨道交通图像高维多尺度维特征;将高维多尺度特征输入至记忆注意力模块,得到交叉注意力计算结果;根据提示编码,利用视觉大模型解码器对编码后的图像特征进行掩码解码,确定目标指针列表并初始化掩码解码器的权重,调整视觉大模型,识别待测轨道运行环境图像,实现轨道图像的语义分割。
1.一种面向轨道交通的视觉大模型高效微调及语义分割方法,其特征在于,所述面向轨道交通的视觉大模型高效微调及语义分割方法包括:利用自动化标注技术对采集的轨道运行环境图像进行标注,构建轨道运行环境语义分割数据集,并利用所述轨道运行环境语义分割数据集训练视觉大模型;所述视觉大模型包括记忆注意力模块;在所述视觉大模型的训练过程中,利用所述视觉大模型中的掩码自编码器对所述轨道运行环境语义分割数据集中的轨道运行环境图像进行特征编码,确定编码后的环境图像,并提取所述编码后的环境图像中的多尺度高维特征,具体包括:利用掩码自编码器预训练的图像编码器,提取所述轨道运行环境图像中的图像特征,得到图像多尺度高维特征信息;所述预训练的图像编码器包括一个带有 窗口注意力和四个等间距全局注意力块的ViT-H/16模型;基于所述图像多尺度高维特征信息,采用预训练的图像编码器对所述轨道运行环境图像进行特征编码,确定所述轨道运行环境图像的多尺度高维特征表示;其中,采用MAE预训练的Hiera图像编码器对轨道运行环境图像进行特征编码,分别采用特征编码器第三和第四阶段的输出作为图像的多尺度高维特征表示,即大小为 和 的图像特征图,以此为每张图像生成嵌入;来自第一阶段和第二阶段采样步长为4和8的特征添加到掩码解码器的上采样层中;所述多尺度高维特征包括提示图像的记忆和目标指针的记忆;将所述多尺度高维特征输入至所述记忆注意力模块,并利用所述记忆注意力模块中的 块对所述提示图像的记忆和所述目标指针的记忆进行交叉注意力计算,得到交叉注意力计算结果;记忆注意力模块采用4个 块,每个块执行自注意力然后对提示图像和目标指针的记忆进行交叉注意力计算并存储在记忆库中,再经过多层感知机进行特征映射;在 模块中除了正弦绝对位置嵌入之外,在自注意力层和交叉注意力层中使用二维空间旋转位置嵌入,具体表示为: ; ; ;其中, 为图像二维空间位置的坐标分量; 为 维向量; 为特征维度上的分组索引,取值范围为 ; 为旋转角度; 是一个超参数; 是经过编码后的向量;基于所述交叉注意力计算结果,根据提示编码,利用所述视觉大模型中的掩码解码器对所述编码后的环境图像进行掩码解码,确定对象指针列表;基于所述对象指针列表,初始化掩码解码器的权重,并采用提示图像和提示文本注入轨道运行环境图像分割任务的知识,调整所述视觉大模型;根据调整后的视觉大模型识别待测轨道运行环境图像,确定待测轨道运行环境。
2.根据权利要求1所述的面向轨道交通的视觉大模型高效微调及语义分割方法,其特征在于,利用自动化标注技术对采集的轨道运行环境图像进行标注,构建轨道运行环境语义分割数据集,具体包括:从多源数据采集和开源轨道数据集中采集轨道运行环境图像;基于高斯滤波去除所述轨道运行环境图像的噪声,确定去噪后的轨道运行环境图像;利用自动化标注技术对所述去噪后的轨道运行环境图像进行标注,确定带有标注的轨道运行环境图像;利用图像增强技术增强所述带有标注的轨道运行环境图像的对比度和清晰度,得到增强后的轨道运行环境图像,构建轨道运行环境语义分割数据集。
3.根据权利要求1所述的面向轨道交通的视觉大模型高效微调及语义分割方法,其特征在于,基于所述交叉注意力计算结果,根据提示编码,利用所述视觉大模型中的掩码解码器对所述编码后的环境图像进行掩码解码,确定对象指针列表,具体包括:基于所述交叉注意力计算结果,利用提示编码器将稀疏提示文本和密集提示文本映射到256维向量嵌入,得到图像嵌入;所述256维向量嵌入为文本特征;利用掩码解码器将所述图像嵌入和所述提示编码映射到输出掩码,确定掩码信息;所述掩码解码器包括修改后的 解码器块和一个动态掩码预测头;根据所述掩码信息,构建对象指针列表。
4.根据权利要求3所述的面向轨道交通的视觉大模型高效微调及语义分割方法,其特征在于,利用掩码解码器将所述图像嵌入和所述提示编码映射到输出掩码,确定掩码信息,具体包括:基于所述图像嵌入,将输入掩码输入至所述视觉大模型,利用第一卷积操作缩小所述输入掩码的分辨率;利用第二卷积操作将缩小后的输入掩码的维度映射到256维图像特征,得到掩码嵌入;将所述掩码嵌入与所述图像嵌入相加,得到输出掩码;基于所述输出掩码,根据所述修改后的 解码器对提示标记进行自注意力操作,并从所述提示标记至所述图像嵌入进行交叉注意力操作,确定交叉注意力操作结果;基于所述交叉注意力操作结果,利用逐点MLP更新每个提示标记,从图像嵌入到提示标记进行交叉注意力操作,更新所述图像嵌入,得到新的图像嵌入;根据新的图像嵌入和所述逐点MLP输出之间的空间逐点乘积,预测掩码信息。
5.根据权利要求4所述的面向轨道交通的视觉大模型高效微调及语义分割方法,其特征在于,根据新的图像嵌入和所述逐点MLP输出之间的空间逐点乘积,预测掩码信息,之后还包括:基于所述掩码信息,构建记忆库;所述记忆库包括最近图像的信息和提示图像的信息;基于记忆编码器和所述记忆库,利用所述新的图像嵌入,并融合所述掩码信息,得到记忆特征;将所述记忆特征进行投影,并将所述目标指针的记忆进行拆分,得到目标指针的记忆标记;基于所述目标指针的记忆标记,对所述记忆库进行交叉注意力操作,确定预训练视觉大模型。
6.根据权利要求5所述的面向轨道交通的视觉大模型高效微调及语义分割方法,其特征在于,基于所述对象指针列表,初始化掩码解码器的权重,并采用提示图像和提示文本注入轨道运行环境图像分割任务的知识,调整所述视觉大模型,具体包括:在所述视觉大模型的训练过程中,调整所述掩码解码器,得到新的掩码解码器;基于所述新的掩码解码器,采用提示图像和提示文本注入所述轨道运行环境图像分割任务的知识;基于所述知识,利用公式 得到输出提示;其中, 为跨所有高效自适应块共享的上投影层; 为附加到SAM模型每个 层的输出提示; 为激活函数; 为专门为每个自适应块设计的线性层; 为任务特定知识;基于所述输出提示调整所述视觉大模型。



