有效
一种运动与外观解耦的多尺度交互与语义校准视频摘要方法
张云佐、仇紫悦、王凯、井海明、霍磊、沙金、陈丹
深圳富创通科技有限公司
摘要
本发明公开了一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,属于计算机视觉技术领域。所述方法包括:对输入视频帧序列分别提取多尺度运动特征和外观特征,得到对应特征金字塔;将运动特征金字塔和外观特征金字塔输入视频摘要模型,通过模型预测初始帧级重要性分数序列;再通过双向LSTM捕捉帧间时序依赖,强化关键动作边界的分数,并通过多样性惩罚减少冗余帧,输出优化后的帧级重要性分数序列;最后通过施加时间间隔约束优化帧分布,经通过贪婪算法选择关键帧生成视频摘要。本方法有效解决现有视频摘要方法中运动与外观特征耦合、多尺度表征不足、特征融合机制简单、模态权重失衡问题,在SumMe和TVSum基准数据集上的实验结果证明了其有效性。
1.一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,其特征在于,包括以下步骤:S1:读取输入的视频帧序列,通过特征提取器分别提取多尺度的运动特征和外观特征,输出对应的运动特征金字塔和外观特征金字塔,所述特征提取器的具体构成及金字塔生成过程包括:运动特征金字塔生成:针对视频帧序列,利用MS-RAFT + 深度光流估计网络获取像素级光流信息,形成包含1/16、1/8、1/4、1/2尺度的4级运动特征金字塔;外观特征金字塔生成:针对视频帧序列,利用预训练ResNet50网络提取基础外观特征,再利用特征金字塔网络FPN进行多尺度转换与融合,生成与运动特征金字塔匹配的4级外观特征金字塔;同时,从最高1/2尺度提取全局语义向量,为后续融合提供语义基准;S2:将运动特征金字塔与外观特征金字塔输入视频摘要生成模型,通过模型预测初始帧级重要性分数序列,所述视频摘要生成模型包括:跨模态语义解耦器:所述跨模态语义解耦器是以所述运动特征金字塔与外观特征金字塔作为输入,采用注意力引导和门控机制对同一尺度的运动特征和外观特征进行解耦,输出独立语义空间的运动特征金字塔和外观特征金字塔;动态多尺度交互模块:所述动态多尺度交互模块是以所述独立语义空间的运动特征金字塔和外观特征金字塔为输入,先对同尺度跨模态的运动特征与外观特征进行模态对齐与拼接;再通过跨尺度双向路径实现全局与局部信息互补;最后基于各尺度特征与全局语义向量的余弦相似度生成动态权重,经加权融合输出多尺度帧级融合特征;语义一致性校准器:所述的语义一致性校准器以多尺度帧级融合特征和全局语义向量为输入,通过三重机制实现特征与全局主题对齐,首先计算各尺度帧级融合特征与全局语义向量的余弦相似度,筛选并弱化偏离主题的特征,其次对保留特征施加L2距离约束,最后依据光流梯度动态调整帧损失权重以强化时序关键位置一致性,最终输出校准后的多尺度帧级融合特征;分数预测:基于校准后的多尺度帧级融合特征,通过加权余弦相似度计算与全局语义向量的相关性,经Sigmoid函数映射输出初始帧级重要性分数,将所有帧的初始重要性分数按时间顺序排列,即得到初始帧级重要性分数序列;S3:将所述初始帧级重要性分数序列通过双向LSTM捕捉帧间时序依赖,强化关键动作边界的分数,并通过多样性惩罚减少冗余帧,输出优化后的帧级重要性分数序列;S4:将所述优化后的帧级重要性分数序列通过施加时间间隔约束优化帧分布,最后通过贪婪算法选择关键帧,生成视频摘要。
2.如权利要求1所述的一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,其特征在于,所述跨模态语义解耦器包括:构建注意力引导与门控机制的跨模态交互机制,通过运动引导外观解耦与外观约束运动解耦两个分支,实现运动与外观特征在对应尺度下的独立解耦与语义分离;运动引导外观解耦:利用运动特征生成注意力权重,突出外观特征中与运动相关的动态信息,运动引导外观注意力权重计算公式为: ,其中:Softmax(⋅)表示归一化函数,F M 表示运动特征,F A 表示外观特征,W M 表示作用于运动特征的可学习权重矩阵,W A 表示作用于外观特征的可学习权重矩阵,(⋅) T 表示转置操作, 表示缩放因子;外观约束运动解耦:通过门控机制抑制运动特征中受外观干扰的冗余信息,门控机制权重计算公式为: ,其中: 表示Sigmoid函数, 表示运动与外观特征在通道维度拼接, 表示门控参数;独立语义空间映射:将每个尺度解耦后运动特征F M 与外观特征F A ,分别映射至独立语义空间,生成独立语义空间的运动特征金字塔与外观特征金字塔。
3.如权利要求1所述的一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,其特征在于,所述动态多尺度交互模块包括:构建同尺度运动与外观特征协同机制,通过1×1卷积将运动特征与外观特征的通道数统一调整,之后在通道维度进行拼接形成包含运动与外观协同信息的同尺度特征,最后对拼接后的特征施加 LayerNorm做归一化,让融合特征更加稳定;构建双向路径实现跨尺度特征交互,包括自下而上语义引导路径和自上而下细节增强路径;动态尺度权重融合:根据各尺度特征与全局语义向量 的相似度生成权重,然后进行多尺度融合,最后得到多尺度帧级融合特征;动态尺度权重计算公式为: ,其中: 表示指数函数, 表示余弦相似度函数, 表示s尺度特征, 表示全局语义向量;多尺度融合计算公式为: ,其中: 表示s尺度特征的动态权重, 表示s尺度特征。
4.如权利要求1所述的一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,其特征在于,所述语义一致性校准器包括:构建相似度筛选机制,计算每级尺度融合特征 与全局语义向量 的余弦相似度,筛选出相似度低于阈值的特征,降低其在后续计算中的权重;余弦相似度计算公式为: ,其中 表示余弦相似度函数, 表示s尺度融合特征, 为全局语义向量;构建多尺度L2距离约束,计算各尺度融合特征 与 的L2损失;所述L2距离约束计算公式为: ,其中:T表示特征序列的长度,t表示循环变量,Pooling(⋅)表示为全局平均池化操作, 表示s尺度融合特征,(t,:)表示选第t行的所有列元素, 为全局语义向量;根据光流特征梯度动态调整各帧的损失权重,光流损失权重计算公式为:w t =Grad(F M (t)),Grad(⋅)表示光流梯度计算函数,F M (t)表示第t帧的光流特征;经过三重机制的优化,输出校准后的多尺度帧级融合特征F t 。
5.如权利要求1所述的一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,其特征在于,所述分数预测包括:将校准后的多尺度帧级融合特征F t 拆分为 4个独立特征向量对应不同尺度,为每个尺度分配权重 ,将各尺度的余弦相似度按预设权重ω加权求和,得到第t帧的综合相关性分数;将综合相关性分数通过Sigmoid函数映射到[0,1]区间,生成最终的初始帧级重要性分数,所有帧的初始重要性分数按时间顺序排列,即得到初始帧级重要性分数序列。
6.如权利要求1所述的一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,其特征在于,所述优化帧级重要性分数序列包括:构建双向LSTM提取时序特征,通过前向、后向隐藏状态拼接得到时序增强特征;计算各帧与相邻帧的余弦相似度均值作为时序关联强度,求时序得分梯度,若超过阈值则判定为关键动作帧,则提升其重要性分数;进行多样性惩罚计算,计算任意两帧校准后特征的余弦相似度,若某帧t与其他帧的相似度超阈值且其他帧分数更高,则对t帧施加惩罚;将时序增强和多样性惩罚结合,得到优化后的帧级重要性分数序列。
7.如权利要求1所述的一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,其特征在于,所述生成视频摘要包括:为优化后的帧级重要性分数序列进行筛选,首先,选分数最高帧加入集合S;后续候选帧若与集合S中已有帧的索引间隔小于最小阈值,暂移至等待集合,循环操作至候选池为空或集合S达到目标规模;使用贪婪算法从候选池的顶部开始,依次选取关键帧,直到数量达到目标摘要的长度为止,最后,将离散的关键帧索引集合 S 转换为连续的视频片段,生成最终的视频摘要。



