1.一种多模态图像融合决策方法,其特征在于,包括:将获取的当前帧对应的RGB图像和DVS图像分别输入对应的特征编码器进行编码,得到RGB编码特征和DVS编码特征;获取所述当前帧对应的时空掩码矩阵,将所述RGB编码特征、所述DVS编码特征和所述时空掩码矩阵输入预设层数互相级联的注意力融合结构进行特征融合,对于每个所述注意力融合结构,获取第一输入数据和第二输入数据,所述第一输入数据的初始值为所述RGB编码特征,所述第二输入数据的初始值为所述DVS编码特征;在对应的所述注意力融合结构中,根据所述第一输入数据得到第一查询向量,根据所述DVS编码特征得到第一键向量和第一值向量,根据所述第二输入数据得到第二键向量和第二值向量,根据所述DVS编码特征得到第二查询向量,并根据所述时空掩码矩阵、所述第一查询向量、所述第一键向量和所述第一值向量计算第一输出数据,以及根据所述时空掩码矩阵、所述第二查询向量、所述第二键向量和所述第二值向量计算第二输出数据;对于级联的两个所述注意力融合结构,对应的前一个所述第一输出数据为后一个的所述第一输入数据、前一个所述第二输出数据为后一个的所述第二输入数据,最后一个所述注意力融合结构的所述第一输出数据为RGB融合特征、所述第二输出数据为DVS融合特征,并将每一个所述注意力融合结构对应的所述第一输出数据和第二输出数据输入对应的特征内存结构进行数据处理;在所述特征内存结构中,根据所述第一输出数据和所述第二输出数据的累加结果得到交互键向量和交互值向量,获取当前所述注意力融合结构对应的初始交互向量作为交互查询向量,所述初始交互向量的初始值为预设向量;根据所述交互查询向量、所述交互键向量、所述交互值向量进行注意力计算得到交叉注意力向量,根据所述交叉注意力向量得到交互特征;将所述RGB融合特征、所述DVS融合特征和所述交互特征输入解码器进行解码,得到所述当前帧对应的预测结果。
2.根据权利要求1所述的多模态图像融合决策方法,其特征在于,所述RGB图像按照预设分块信息划分成多个图像分块,所述根据所述时空掩码矩阵、所述第一查询向量、所述第一键向量和所述第一值向量计算第一输出数据,包括:基于所述第一查询向量和所述第一键向量计算每个所述图像分块对应的第一注意力矩阵;从所述时空掩码矩阵中获取所述图像分块对应的分块掩码矩阵,计算所述分块掩码矩阵与所述第一注意力矩阵的乘积,得到每个所述图像分块对应的第一注意力掩码矩阵;基于所述第一注意力矩阵和所述第一值向量计算所述图像分块对应的分块输出数据,基于所述分块输出数据得到所述第一输出数据。
3.根据权利要求2所述的多模态图像融合决策方法,其特征在于,所述获取所述当前帧中所述图像分块对应的分块掩码矩阵之前,所述方法还包括:根据所述RGB图像的所述分块信息,生成每个分块位置对应的初始掩码矩阵;针对每个所述分块位置,以所述分块位置为中心,按照距离确定至少一个位置圈,基于所述位置圈从近到远的顺序,依次确定每个所述分块位置对应的掩码权重初始值,同一个所述位置圈中所述分块位置的所述掩码权重初始值相同;将所述掩码权重初始值填充在所述初始掩码矩阵中对应位置,得到所述当前帧的所述分块掩码矩阵。
4.根据权利要求3所述的多模态图像融合决策方法,其特征在于,所述将所述掩码权重初始值填充在所述初始掩码矩阵中对应位置,得到所述当前帧的所述分块掩码矩阵之前,所述方法还包括:获取所述当前帧对应的前一帧中每个所述分块位置对应的所述掩码权重初始值作为参考权重值,当所述当前帧为第一帧时,所述参考权重值为初始值;对于每个所述分块位置,调整所述当前帧中的所述掩码权重初始值大于所述参考权重值,对所述掩码权重初始值进行更新。
5.根据权利要求1所述的多模态图像融合决策方法,其特征在于,根据所述交叉注意力向量得到所述交互特征,包括:将所述交叉注意力向量输入多头注意力结构进行特征处理,得到交互输出数据,最后一个所述注意力融合结构对应的所述交互输出数据为所述交互特征;将所述交叉注意力向量和所述初始交互向量相加,对所述初始交互向量进行更新。
6.一种多模态图像融合决策装置,其特征在于,包括:编码模块:用于将获取的当前帧对应的RGB图像和DVS图像分别输入对应的特征编码器进行编码,得到RGB编码特征和DVS编码特征;融合模块:用于获取所述当前帧对应的时空掩码矩阵,将所述RGB编码特征、所述DVS编码特征和所述时空掩码矩阵输入预设层数互相级联的注意力融合结构进行特征融合,对于每个所述注意力融合结构,获取第一输入数据和第二输入数据,所述第一输入数据的初始值为所述RGB编码特征,所述第二输入数据的初始值为所述DVS编码特征;在对应的所述注意力融合结构中,根据所述第一输入数据得到第一查询向量,根据所述DVS编码特征得到第一键向量和第一值向量,根据所述第二输入数据得到第二键向量和第二值向量,根据所述DVS编码特征得到第二查询向量,并根据所述时空掩码矩阵、所述第一查询向量、所述第一键向量和所述第一值向量计算第一输出数据,以及根据所述时空掩码矩阵、所述第二查询向量、所述第二键向量和所述第二值向量计算第二输出数据;对于级联的两个所述注意力融合结构,对应的前一个所述第一输出数据为后一个的所述第一输入数据、前一个所述第二输出数据为后一个的所述第二输入数据,最后一个所述注意力融合结构的所述第一输出数据为RGB融合特征、所述第二输出数据为DVS融合特征,并将每一个所述注意力融合结构对应的所述第一输出数据和第二输出数据输入对应的特征内存结构进行数据处理;在所述特征内存结构中,根据所述第一输出数据和所述第二输出数据的累加结果得到交互键向量和交互值向量,获取当前所述注意力融合结构对应的初始交互向量作为交互查询向量,所述初始交互向量的初始值为预设向量;根据所述交互查询向量、所述交互键向量、所述交互值向量进行注意力计算得到交叉注意力向量,根据所述交叉注意力向量得到交互特征;解码模块:用于将所述RGB融合特征、所述DVS融合特征和所述交互特征输入解码器进行解码,得到所述当前帧对应的预测结果。
7.一种电子设备,其特征在于,所述电子设备包括存储器和处理器,所述存储器存储有计算机程序,所述处理器执行所述计算机程序时实现权利要求1至5任一项所述的多模态图像融合决策方法。
8.一种存储介质,所述存储介质存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至5中任一项所述的多模态图像融合决策方法。