有效

深度伪造视频的多模态检测方法、装置和计算机设备

肖曼、叶健彬、刘波、王晓东、马行空、洪学恕、陈旺群、蔡依青、王莹
中国人民解放军国防科技大学

摘要

本申请涉及一种深度伪造视频的多模态检测方法、装置和计算机设备。所述方法包括:提取任意类型视频的视觉模态与听觉模态,并将听觉模态转换为对应的梅尔频谱;分别对分割视觉模态得到的视频块和分割梅尔频谱得到的音频组进行特征提取,得到视频特征和音频特征;将视频特征与音频特征输入预先构建的同步模型,得到音视频双向延迟分布;集合双向延迟分布形成原始视频的初始分布,将初始分布输入预先构建的短时依赖估计模型进行视频后续分布估计,并通过计算损失对短时依赖估计模型进行反向传播训练,得到训练好的短时依赖估计模型进行视觉模态与听觉模态的伪造检测。采用本方法能够兼顾视觉和听觉两种模态的伪造检测,提高伪造检测性能。