1.一种深度伪造视频的多模态检测方法,其特征在于,所述方法包括:提取任意类型视频的视觉模态与听觉模态,并将所述听觉模态转换为对应的梅尔频谱;将分割所述视觉模态得到的视频块输入视频编码器进行特征提取,得到视频特征,将分割所述梅尔频谱得到的音频组输入音频编码器进行特征提取,得到音频特征将所述视频特征与音频特征输入预先构建的同步模型,通过同步模型进行音视频双向同步分布建模计算,输出得到音频对视频和视频对音频的双向延迟分布;集合所述双向延迟分布形成原始视频的初始分布,将所述初始分布输入预先构建的短时依赖估计模型进行视频后续分布估计,并根据估计的后续分布与初始分布之间的损失,对所述短时依赖估计模型进行反向传播训练,得到训练好的短时依赖估计模型,并根据该训练好的短时依赖估计模型对待检测视频进行视觉模态与听觉模态的伪造检测。
2.根据权利要求1所述的方法,其特征在于,提取任意类型视频的视觉模态与听觉模态,并将所述听觉模态转换为对应的梅尔频谱,包括:获取任意类型的视频 其中 T、H和W分别表示该视频的时间长度、高度和宽度,C表示该视频每帧的通道数, 表示实数空间;提取视频 的视觉模态V与听觉模态A,分别表示为V={f 1 ,f 2 ,f 3 ,...,f n };A={a 1 ,a 2 ,a 3 ,...,a n };其中,f n 表示视觉模态V中的第n帧,a n 表示每帧视频对应的音频,n为视觉模态V中的总帧数;将所述听觉模态A转换为对应的梅尔频谱 表示为其中,Mel_spectrogram表示梅尔频谱处理。
3.根据权利要求2所述的方法,其特征在于,将分割所述视觉模态得到的视频块输入视频编码器进行特征提取,得到视频特征,包括:将视觉模态V分割成视频块,每个视频块中包含五个相邻的帧,具体表示为其中, 表示第i个视频块,f i 表示视觉模态V中的第i帧;将每个视频块输入视频编码器VisualEncoder进行特征提取,得到视频特征,表示为其中, 表示第i个视频块对应的视频特征。
4.根据权利要求2所述的方法,其特征在于,将分割所述梅尔频谱得到的音频组输入音频编码器进行特征提取,得到音频特征,包括:将梅尔频谱 分割成音频片段后,将五个相邻的音频片段捆绑形成音频组,具体表示为其中, 表示第i个音频组, 表示梅尔频谱 分割后得到的第i个音频片段;将每个音频组输入音频编码器AudioEncoder进行特征提取,得到音频特征,表示为其中, 表示第i个音频组对应的音频特征。
5.根据权利要求1所述的方法,其特征在于,将所述视频特征与音频特征输入预先构建的同步模型,通过同步模型进行音视频双向同步分布建模计算,输出得到音频对视频和视频对音频的双向延迟分布,包括:将每个视频块对应的视频特征与每个音频组对应的音频特征输入预先构建的同步模型,通过同步模型进行音视频双向同步分布建模计算,输出得到音频对视频和视频对音频的双向延迟分布,表示为其中, 表示第i个视频块对应的视频对音频的延迟分布, 表示第i个音频组对应的音频对视频的延迟分布;MP_AviT表示所述同步模型, 表示第i个视频块对应的视频特征, 表示第i个音频组对应的音频特征。
6.根据权利要求5所述的方法,其特征在于,集合所述双向延迟分布形成原始视频的初始分布,将所述初始分布输入预先构建的短时依赖估计模型进行视频后续分布估计,包括:将所有视频块对应的视频对音频的延迟分布和所有音频组对应的音频对视频的延迟分布进行集合,得到原始视频的初始分布Ψ(i),表示为其中, 表示第i个视频块对应的视频对音频的延迟分布与第i个音频组对应的音频对视频的延迟分布的结合,N表示视频块与音频组的数量;将所述初始分布Ψ(i)输入预先构建的短时依赖估计模型,根据所述短时依赖估计模型依次进行两次卷积编码和两次反卷积解码操作,估计得到原始视频短时间内的后续分布e(i+1),表示为其中,Conv表示卷积编码操作,Deconv表示反卷积解码操作。
7.根据权利要求6所述的方法,其特征在于,根据估计的后续分布与初始分布之间的损失,对所述短时依赖估计模型进行反向传播训练,得到训练好的短时依赖估计模型,包括:利用KL散度计算原始视频的后续分布e(i+1)与初始分布Ψ(i)之间的损失Loss,表示为Loss=KLDivLoss(e(i+1),Ψ(i));其中,KLDivLoss表示计算KL散度的损失函数;根据损失Loss对所述短时依赖估计模型进行反向传播训练,得到训练好的短时依赖估计模型。
8.一种深度伪造视频的多模态检测装置,其特征在于,所述装置包括:音视频双向同步分布建模模块,用于提取任意类型视频的视觉模态与听觉模态,并将所述听觉模态转换为对应的梅尔频谱;将分割所述视觉模态得到的视频块输入视频编码器进行特征提取,得到视频特征,将分割所述梅尔频谱得到的音频组输入音频编码器进行特征提取,得到音频特征;将所述视频特征与音频特征输入预先构建的同步模型,通过同步模型进行音视频双向同步分布建模计算,输出得到音频对视频和视频对音频的双向延迟分布;短时依赖估计建模模块,用于集合所述双向延迟分布形成原始视频的初始分布,将所述初始分布输入预先构建的短时依赖估计模型进行视频后续分布估计,并根据估计的后续分布与初始分布之间的损失,对所述短时依赖估计模型进行反向传播训练,得到训练好的短时依赖估计模型,并根据该训练好的短时依赖估计模型对待检测视频进行视觉模态与听觉模态的伪造检测。
9.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至7中任一项所述方法的步骤。