有效
一种无人机视角下红外-可见光跨模态数据融合方法
夏靖远、李烨、张双辉、刘振、姜卫东
中国人民解放军国防科技大学
摘要
本申请涉及无人机信号处理与计算机智能图像融合技术领域,特别是涉及一种无人机视角下红外‑可见光跨模态数据融合方法。所述方法包括:通过归一化预处理来消除无人机数据的视角敏感性与运动干扰,再通过自注意力机制对输入的可见光图像和红外图像进行初步的全局特征提取,之后利用交叉注意力机制对可见光图像特征和红外图像特征进行信息交互和特征融合;接着利用对比学习和等变一致性构建优化目标,增强多模态特征的互补性和可判别性,以提高无人机视角下红外‑可见光跨模态图像融合的鲁棒性和有效性。
1.一种无人机视角下红外-可见光跨模态数据融合方法,其特征在于,所述方法包括:对无人机采集的红外图像和可见光图像进行归一化预处理,消除无人机数据的视角敏感性与运动干扰,得到归一化后的红外图像和归一化后的可见光图像;构建数据融合模型;所述数据融合模型包括基于自注意力机制的特征提取模型、基于交叉注意力机制的特征交互模块、基于对比学习的特征增强模块、基于等变一致性的特征优化模块;根据所述基于自注意力机制的特征提取模型对所述归一化后的红外图像和归一化后的可见光图像进行全局特征提取,得到红外特征和可见光特征;将所述红外特征和可见光特征输入基于交叉注意力机制的特征交互模块,通过双路交叉注意力实现两种特征的信息交互与融合,得到融合特征;在所述基于对比学习的特征增强模块利用模态对比学习损失对所述融合特征进行特征增强;在所述基于等变一致性的特征优化模块利用等变一致性损失优化所述融合特征,使增强后的融合特征与红外特征、可见光特征的分布保持一致性,得到优化后的融合特征完成无人机视角下红外-可见光跨模态数据融合;所述等变一致性损失为:其中, 为批次样本集合, 表示批次大小, 表示批次下得到的所有融合特征集合, 和 分别表示批次下得到的所有红外和可见光特征集合, 是KL散度的计算公式。
2.根据权利要求1所述的方法,其特征在于,对无人机采集的红外图像和可见光图像进行归一化预处理,消除无人机数据的视角敏感性与运动干扰,得到归一化后的红外图像和归一化后的可见光图像,包括:对无人机采集的红外图像和可见光图像进行归一化预处理,得到归一化后的红外图像和归一化后的可见光图像分别为:其中, 和 分别为红外图像的均值与标准差, 和 分别为可见光图像的均值与标准差; 和 表示归一化后的红外图像和归一化后的可见光图像, 表示像素位置, 表示红外图像, 表示可见光图像。
3.根据权利要求1所述的方法,其特征在于,所述基于自注意力机制的特征提取模型以多层多头自注意力层为核心,每层包含层归一化单元、多头自注意力单元和前馈层单元,根据所述基于自注意力机制的特征提取模型对所述归一化后的红外图像和归一化后的可见光图像进行全局特征提取,得到红外特征和可见光特征,包括:将归一化后的图像按 像素块划分为子区域,每个子区域展平为 维特征向量,得到红外特征序列 与可见光特征序列 ,N表示子区域数量;利用层归一化单元对红外特征序列与可见光特征序列进行标准化处理,得到层归一化的输出;在多头自注意力单元将所述层归一化的输出分别投影到查询矩阵、键矩阵和值矩阵;将查询矩阵、键矩阵和值矩阵以余弦相似度为度量的自注意力模块,通过缩放因子和softmax运算获得子序列间的注意力权重,再对值矩阵进行加权融合,得到自注意力层的最终输出;利用多头自注意层将查询矩阵、键矩阵和值矩阵分别投影至多个特征子空间,分别求取注意力后再拼接,得到多头注意力层输出;将多头注意力层输出输入前馈层,得到红外特征和可见光特征。
4.根据权利要求3所述的方法,其特征在于,在多头自注意力单元将所述层归一化的输出分别投影到查询矩阵、键矩阵和值矩阵,包括:在多头自注意力单元将所述层归一化的输出分别投影到查询矩阵 、键矩阵 和值矩阵 为:其中, , , , , 表示层归一化的输出。
5.根据权利要求3所述的方法,其特征在于,将查询矩阵、键矩阵和值矩阵以余弦相似度为度量的自注意力模块,通过缩放因子和softmax运算获得子序列间的注意力权重,再对值矩阵进行加权融合,得到自注意力层的最终输出,包括:将查询矩阵 、键矩阵 和值矩阵 以余弦相似度为度量的自注意力模块,通过缩放因子 和 softmax 运算获得子序列间的注意力权重,再对值矩阵进行加权融合,得到自注意力层的最终输出 。
6.根据权利要求3所述的方法,其特征在于,利用多头自注意层将查询矩阵、键矩阵和值矩阵分别投影至多个特征子空间,分别求取注意力后再拼接,得到多头注意力层输出,包括:利用多头自注意层将查询矩阵、键矩阵和值矩阵分别投影至多个特征子空间,分别求取注意力后再拼接,得到多头注意力层输出为:其中, 为多头自注意力层最终输出, 表示拼接操作, 表示第 个注意力头的输出, 表示注意力头的数目, 表示恢复矩阵。
7.根据权利要求3所述的方法,其特征在于,将最后的多头注意力层输出输入前馈层,得到红外特征和可见光特征,包括:将最后的多头注意力层输出输入前馈层,得到红外特征和可见光特征分别为:其中, 表示前馈层网络, 和 分别表示提取到的红外特征和可见光特征, 表示所提出的基于自注意力机制的特征提取层, 表示多头注意力机制提取网络, 和 表示归一化后的红外图像和可见光图像, 表示层归一化操作。
8.根据权利要求1所述的方法,其特征在于,所述双路交叉注意力包括以红外模态为主导的红外-可见光交叉注意力分支和以可见光模态为主导的可见光-红外交叉注意力分支,将所述红外特征和可见光特征输入基于交叉注意力机制的特征交互模块,通过双路交叉注意力实现两种特征的信息交互与融合,得到融合特征,包括:在红外-可见光交叉注意力分支以红外特征为 ,可见光特征为键 和 ,计算跨注意力机制得到特征 ,表示为:在可见光-红外交叉注意力分支以红外特征为 ,可见光特征为键 和 ,计算跨注意力机制得到特征 ,表示为:将特征 和 拼接后通过卷积调整特征维度,得到融合特征 ,表示为:其中, 表示卷积操作, 为卷积权重。
9.根据权利要求1所述的方法,其特征在于,所述模态对比学习损失为:其中, 表示融合特征, 和 表示正样本为对应的两个模态的特征, 表示该批次中除了锚点 以外其他所有样本的集合, 表示 中的样本, 表示温度超参数。



