有效

基于双重知识蒸馏的视觉定位方法、装置、设备和存储器

胡越、武万森、秦龙、许凯、张淼、祝建成、尹全军、刘婷、王有凯
中国人民解放军国防科技大学

摘要

本申请涉及一种基于双重知识蒸馏的视觉定位方法、装置、设备和存储器。该方法包括:将获取的原始图像和对应的语言查询作为训练样本;构建基于双重知识蒸馏的视觉定位模型;该模型包括学生网络、语义知识蒸馏模块和定位知识蒸馏模块;语义知识蒸馏模用于采用教师网络将训练样本编码为视觉特征和语义特征,将视觉特征和语义特征蒸馏到学生网络;定位知识蒸馏模块用于采用对比学习方式学习定位知识;根据训练样本和总损失函数对多视觉定位模型进行训练,将待测图像和对应的语言查询输入到训练好的视觉定位模型的学生网络中,得到定位边界框。该方法提高了基础架构的跨模态表示,并使两种模态之间的相关性更加紧密,采用该方法可提高视觉定位精度。