有效
基于双重知识蒸馏的视觉定位方法、装置、设备和存储器
胡越、武万森、秦龙、许凯、张淼、祝建成、尹全军、刘婷、王有凯
中国人民解放军国防科技大学
胡
胡越 专利 55
中国人民解放军国防科技大学计算技术物理仪器电子数据处理
武
武万森 专利 3
中国人民解放军国防科技大学物理仪器计算技术导航
秦
秦龙 专利 91
中国人民解放军国防科技大学电子数据处理计算技术物理仪器
许
许凯 专利 84
中国人民解放军国防科技大学电子数据处理计算技术物理仪器
张
张淼 专利 14
中国人民解放军国防科技大学计算技术物理仪器计算模型系统
祝
祝建成 专利 22
中国人民解放军国防科技大学计算技术物理仪器电子数据处理
尹
尹全军 专利 135
中国人民解放军国防科技大学程序控制装置数据存储检索电子数据处理
刘
刘婷 专利 13
中国人民解放军国防科技大学物理仪器计算技术视觉识别
王
王有凯 专利 6
河南理工大学物理仪器化学冶金纤维原料机械处理
摘要
本申请涉及一种基于双重知识蒸馏的视觉定位方法、装置、设备和存储器。该方法包括:将获取的原始图像和对应的语言查询作为训练样本;构建基于双重知识蒸馏的视觉定位模型;该模型包括学生网络、语义知识蒸馏模块和定位知识蒸馏模块;语义知识蒸馏模用于采用教师网络将训练样本编码为视觉特征和语义特征,将视觉特征和语义特征蒸馏到学生网络;定位知识蒸馏模块用于采用对比学习方式学习定位知识;根据训练样本和总损失函数对多视觉定位模型进行训练,将待测图像和对应的语言查询输入到训练好的视觉定位模型的学生网络中,得到定位边界框。该方法提高了基础架构的跨模态表示,并使两种模态之间的相关性更加紧密,采用该方法可提高视觉定位精度。
1.一种基于双重知识蒸馏的视觉定位方法,其特征在于,所述方法包括:将获取的原始图像和对应的语言查询作为训练样本;构建基于双重知识蒸馏的视觉定位模型;所述视觉定位模型包括学生网络、语义知识蒸馏模块和定位知识蒸馏模块;所述语义知识蒸馏模用于采用教师网络将所述训练样本编码为视觉特征和语义特征,将所述视觉特征和所述语义特征从教师网络蒸馏到所述学生网络;所述学生网络用于将所述训练样本进行编码,并根据编码结果和蒸馏所述视觉特征和所述语义特征的进行融合,根据得到的融合特征进行预测,得到预测定位边界框;所述定位知识蒸馏模块用于根据所述预测定位边界框的原始图像或特征向量采用语义定位感知采样机制生成高质量的正负样本,并采用对比学习方式学习定位知识;构建所述视觉定位模型的总损失函数;根据所述训练样本和所述总损失函数对所述视觉定位模型进行训练,得到训练好的视觉定位模型;将待测图像和对应的语言查询输入到训练好的视觉定位模型的学生网络中,得到定位边界框。
2.根据权利要求1所述的方法,其特征在于,构建所述视觉定位模型的总损失函数,包括:构建所述语义知识蒸馏模块、所述定位知识蒸馏模块以及所述学生网络的损失函数;设置损失影响对应的超参数;根据所述超参数、所述语义知识蒸馏模块、所述定位知识蒸馏模块以及所述学生网络的损失函数,得到所述视觉定位模型的总损失函数为:其中,λ giou 、λ sem 、λ loc 为损失影响对应的超参数, 和L giou 分别为学生网络的L1损失和GIoU损失,L loc 为定位知识蒸馏模块的损失函数,L sem 为语义知识蒸馏模块的损失函数。
3.根据权利要求2所述的方法,其特征在于,所述语义知识蒸馏模块的损失函数为:L sem =L sem,v +L sem,l其中,L sem 为语义知识蒸馏模块的损失函数,L sem,v 和L sem,l 分别表示视觉和语言模态的蒸馏损失, 为学生模型的整体视觉特征, 为语义知识蒸馏模块的整体视觉特征,η(·)为自适应层,w(·)为特征白化函数,β为预设参数; 为学生模型的整体语义特征, 为语义知识蒸馏模块的整体语义特征;所述定位知识蒸馏模块的损失函数为:其中, 分别为采用像素级别对齐模块的自蒸馏损失和采用特征级别对齐模块的自蒸馏损失, 分别为图像区域和特征映射区域,N pos 和N neg 分别是正、负样本的数量。
4.根据权利要求1所述的方法,其特征在于,根据所述训练样本和所述总损失函数对所述视觉定位模型进行训练,得到训练好的视觉定位模型,包括:将所述训练样本输入到所述语义知识蒸馏模块中进行视觉特征编码和语义特征编码,对得到的编码进行白化处理,并将得到的白化处理后的视觉特征和语义特征自适应处理后蒸馏到所述学生网络中;将所述训练样本输入到所述学生网络中,得到预测定位边界框;将所述预测定位边界框和对应区域内的原始图像或特征向量输入到所述定位知识蒸馏模块中采用自蒸馏方法得到定位知识;根据白化处理后的视觉特征和语义特征、蒸馏后的视觉特征和语义特征、所述预测定位边界框以及自蒸馏得到的定位知识以及所述总损失函数,对所述视觉定位模型进行训练,得到训练好的视觉定位模型。
5.根据权利要求4所述的方法,其特征在于,所述语义知识蒸馏模块包括教师网络和特征白化模块;所述教师网络包括两个大规模预训练模型CLIP;将所述训练样本输入到所述语义知识蒸馏模块中进行视觉特征编码和语义特征编码,对得到的编码进行白化处理,并将得到的白化处理后的视觉特征和语义特征自适应处理后蒸馏到所述学生网络中,包括:将所述训练样本输入到所述语义知识蒸馏模块的所述教师网络中采用第一所述大规模预训练模型CLIP进行视觉特征编码,采用第二个所述大规模预训练模型CLIP进行语义特征编码,得到视觉特征和语义特征;将所述视觉特征和所述语义特征输入到所述语义知识蒸馏模块的特征白化模块中采用无缩放或偏差的非参数层归一化函数行白化处理,并将白化后的视觉特征和语义特征采用自适应层进行处理;将自适应处理的所述视觉特征和所述语义特征蒸馏到所述学生网络中。
6.根据权利要求4所述的方法,其特征在于,所述学生网络为TransVG网络;所述TransVG网络包括视觉编码器、语言编码器、多模态融合模块以及预测层;将所述训练样本输入到所述学生网络中,得到预测定位边界框,包括:将所述训练样本中原始图像输入到所述学生网络的所述视觉编码器中,得到视觉特征;将所述训练样本中原始图像对应的语言查询输入到所述学生网络的所述语言编码器中,得到语义特征;将所述语义特征、所述视觉特征、可学习token[REG]、蒸馏的教师网络输出的语义特征和视觉特征输入到所述学生网络的所述多模态融合模块中,得到融合特征为:h s =Transformer([f REG ,φ(f l ),φ(f v )])其中,h s 为融合特征,f l 为语义特征,f v 为视觉特征,φ(·)为线性层,f REG 为可学习token[REG];将所述融合特征输入到所述学生网络的所述预测层中,得到预测定位边界框。
7.根据权利要求4所述的方法,其特征在于,所述定位知识蒸馏模块包括对齐模块和语义定位感知采样机制;所述对齐模块包括特征级别对齐模块或像素级别对齐模块;将所述预测定位边界框和对应区域内的原始图像或特征向量输入到所述定位知识蒸馏模块中采用自蒸馏方法得到定位知识,包括:当所述对齐模块为所述像素级别对齐模块时:将所述预测定位边界框和对应区域内的原始图像输入到所述定位知识蒸馏模块的语义定位感知采样机制中,得到多个高质量的像素级别的正样本和负样本;对所有像素级别的正样本和负样本采用所述像素级别对齐模块进行像素级别的对齐,得到每个样本的相关图像区域:其中, 为相关图像区域,s为网格采样大小,(x 1 ,y 1 ,x 2 ,y 2 )为预测定位边界框的左上角和右下角坐标,W×H为尺寸调整;STN是空间变换网络,I为原始图像的像素,STN为空间变换网络;当所述对齐模块为所述特征级别对齐模块时:将所述预测定位边界框和对应区域内的特征向量输入到所述定位知识蒸馏模块的语义定位感知采样机制中,得到多个高质量的特征级别的正样本和负样本;对所有特征级别的正样本和负样本采用所述特征级别对齐模块进行像素级别的对齐,得到每个样本的相关特征映射区域为:其中, 为特征映射区域,f′ v 为视觉特征f v 经过多模态融合模块处理后的视觉特征。
8.一种基于双重知识蒸馏的视觉定位装置,其特征在于,所述装置包括:训练样本获取模块,用于将获取的原始图像和对应的语言查询作为训练样本;基于双重知识蒸馏的视觉定位模型构建模块,用于构建基于双重知识蒸馏的视觉定位模型;所述视觉定位模型包括学生网络、语义知识蒸馏模块和定位知识蒸馏模块;所述语义知识蒸馏模用于采用教师网络将所述训练样本编码为视觉特征和语义特征,将所述视觉特征和所述语义特征从教师网络蒸馏到所述学生网络;所述学生网络用于将所述训练样本进行编码,并根据编码结果和蒸馏所述视觉特征和所述语义特征的进行融合,根据得到的融合特征进行预测,得到预测定位边界框;所述定位知识蒸馏模块用于根据所述预测定位边界框的原始图像或特征向量采用语义定位感知采样机制生成高质量的正负样本,并采用对比学习方式学习定位知识;基于双重知识蒸馏的视觉定位模型训练模块,用于构建所述视觉定位模型的总损失函数;根据所述训练样本和所述总损失函数对所述视觉定位模型进行训练,得到训练好的视觉定位模型;基于双重知识蒸馏的视觉定位模块,用于将待测图像和对应的语言查询输入到训练好的视觉定位模型的学生网络中,得到定位边界框。
9.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至7中任一项所述方法的步骤。
10.一种计算机可读存储器,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至7中任一项所述的方法的步骤。



