1.一种基于联邦学习的多模态通专模型协同训练方法,其特征在于,包括:接收待检索数据,提取待检索数据的数据特征,并基于数据特征建立多模态数据索引,待检索数据包括待检索图像数据、待检索文本数据和待检索音频数据,数据特征包括待检索图像特征、待检索文本特征和待检索音频特征;基于多模态数据索引,通过预设跨模态特征映射网络中的注意力机制处理数据特征,并将已处理的数据特征映射至预设高维特征空间进行融合,得到融合数据特征,以融合待检索图像特征、待检索文本特征和待检索音频特征;将融合数据特征输入至检索通用模型,通过检索通用模型的知识提取层对融合数据特征进行知识提取,得到通用知识表示;将通用知识表示输入至检索专用模型,基于检索专用模型处理通用知识表示,得到待检索数据对应的检索结果,并基于检索结果调整检索通用模型的通用模型参数和检索专用模型的专用模型参数。
2.根据权利要求1所述的方法,其特征在于,所述接收待检索数据,提取待检索数据的数据特征,包括:将所述待检索图像数据进行归一化处理,并将已归一化的所述待检索图像数据对应的像素值映射至预设像素区间内,得到初始待检索图像特征;对所述待检索文本数据进行词向量编码,得到初始待检索文本特征;按照预设帧长度分割所述待检索音频数据,并提取每一已分割的所述待检索音频数据的特征,得到初始待检索音频特征;对所述初始待检索图像特征、所述初始待检索文本特征和所述初始待检索音频特征进行特征标准化,以将所述初始待检索图像特征、所述初始待检索文本特征和所述初始待检索音频特征转换为标准正态分布,得到待检索图像特征、待检索文本特征和待检索音频特征。
3.根据权利要求1所述的方法,其特征在于,在所述将已处理的数据特征映射至预设高维特征空间进行融合,得到融合数据特征之后,还包括:将所述融合数据特征输入至判别器,得到所述融合数据特征对应的概率值;将所述概率值大于预设概率阈值的融合数据特征确定为真实融合特征,将所述概率值不大于所述预设概率阈值的融合数据特征确定为生成融合特征;基于所述真实融合特征和所述生成融合特征优化所述数据特征的融合过程。
4.根据权利要求1所述的方法,其特征在于,所述将通用知识表示输入至检索专用模型,基于检索专用模型处理通用知识表示,得到待检索数据对应的检索结果,包括:将所述数据特征和所述通用知识表示输入至所述检索专用模型,通过所述检索专用模型中的知识接收网络层和专用融合网络层融合所述数据特征和所述通用知识表示,得到初始检索结果;通过所述检索专用模型中的全连接层和激活函数处理所述初始检索结果,得到所述待检索数据对应的检索结果。
5.根据权利要求1所述的方法,其特征在于,所述基于检索结果调整检索通用模型的通用模型参数和检索专用模型的专用模型参数,包括:基于所述检索结果更新所述检索专用模型对应的专用模型参数;接收所述检索结果对应的真实标签,通过所述检索专用模型中的多任务损失函数确定所述检索结果和所述真实标签之间的多任务损失值,所述多任务损失函数包括分类交叉熵损失函数和跨模态对比损失函数;将所述多任务损失值反向传播至所述检索通用模型,以使所述检索通用模型基于所述多任务损失值更新所述通用模型参数。
6.根据权利要求1所述的方法,其特征在于,所述基于数据特征建立多模态数据索引,包括:对同一组所述待检索数据分配唯一标识符,基于所述唯一标识符,建立所述待检索图像特征、所述待检索文本特征和所述待检索音频特征之间的关联映射关系;基于所述关联映射关系,构建图结构的多模态数据索引,所述多模态数据索引中的节点表示同一所述待检索数据的不同模态特征,边表示所述数据特征之间的语义关联强度。
7.根据权利要求1所述的方法,其特征在于,所述通过检索通用模型的知识提取层对融合数据特征进行知识提取,得到通用知识表示,包括:通过所述检索通用模型的中间隐藏层对所述融合数据特征进行知识提取,得到多模态共享特征;通过知识提取层中的门控机制筛选所述多模态共享特征,得到初始通用知识表示,并对所述初始通用知识表示进行正则化约束,得到通用知识表示。
8.一种电子设备,用于存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现权利要求1至7任一项所述的基于联邦学习的多模态通专模型协同训练方法的步骤。
9.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该计算机程序被处理器执行时实现权利要求1至7任一项所述的基于联邦学习的多模态通专模型协同训练方法的步骤。
10.一种计算机程序产品,用于计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时实现权利要求1至7任一项所述的基于联邦学习的多模态通专模型协同训练方法的步骤。