1.多尺度时空建模视频摘要生成装置,其特征在于,包括特征提取模块、多尺度时空建模模块、重要性分类器、摘要生成模块;所述特征提取模块用于将输入视频划分为不重叠的片段,并利用卷积神经网络提取每个视频片段的特征;所述多尺度时空建模模块包括顺序自由排列的多尺度聚合器、级联时间建模模块和并行空间建模模块;所述多尺度聚合器采用反卷积和池化操作获得输入特征的多尺度特征,同时在输入特征前添加片段类别标记,并应用特征融合策略聚合多尺度特征,得到融合后的特征;所述级联时间建模模块由多个级联的时间Mamba块构成,输入特征在多个级联的时间Mamba块中通过残差学习精炼,以融合短期提示和长期事件依赖关系,输出精炼后的特征;所述并行空间建模模块由多个具有共享参数的并行空间Mamba块构成,每个空间Mamba块用于处理单个帧的特征,输入特征经线性层转化为帧级特征后输入空间Mamba块,通过残差学习在空间Mamba块中并行处理,提取空间特征,并将每个空间Mamba块提取的空间特征聚合形成视频内容的特征表示;所述重要性分类器根据多尺度时空建模模块的输出特征,输出重要性分数,并结合损失函数优化重要性分数;所述摘要生成模块用于根据优化后的重要性分数,求解约束的优化问题构建摘要。
2.如权利要求1所述的多尺度时空建模视频摘要生成装置,其特征在于,所述融合后的特征根据以下公式获得:其中, 为低尺度特征; 为基本尺度特征; 为高尺度特征; 为融合后的特征; 为低尺度特征的权重; 为基本尺度特征的权重; 为高尺度特征的权重; 为可学习的线性帧投影, L 表示低尺度、 B 表示基本尺度、 H 表示高尺度。
3.如权利要求1所述的多尺度时空建模视频摘要生成装置,其特征在于,根据以下公式精炼输入特征:其中, 为第 l 个时间Mamba块的输入特征, ; 为第 l 个时间Mamba块; 为第 l -1个时间Mamba块的输入特征。
4.如权利要求1所述的多尺度时空建模视频摘要生成装置,其特征在于,所述视频内容的特征表示根据以下公式形成:其中, 为视频内容的特征表示; 为共享参数的并行空间Mamba块; 为第 t 个帧级特征, 。
5.如权利要求1所述的多尺度时空建模视频摘要生成装置,其特征在于,所述重要性分数根据以下步骤输出:对多尺度时空建模模块的输出特征进行层归一化操作;通过带有 激活函数的全连接层提取层归一化后的特征的更高级语义模式;采用 函数将特征的更高级语义模式归一化为重要性分数,并输出。
6.如权利要求1所述的多尺度时空建模视频摘要生成装置,其特征在于,所述损失函数根据以下公式计算:其中, 为损失函数; 为交叉熵损失函数; 为均方误差损失函数; 为可调的超参数。
7.如权利要求6所述的多尺度时空建模视频摘要生成装置,其特征在于,所述交叉熵损失函数根据以下公式计算:其中, t 为帧的索引值; c 为分类的结果标签; 为第 t 帧的真实标签; 为帧重要性分类器对第 t 帧的预测结果。
8.如权利要求6所述的多尺度时空建模视频摘要生成装置,其特征在于,所述均方误差损失函数根据以下公式计算:其中, 为预测的重要性分数; 为真实归一化的重要性分数。
9.如权利要求1所述的多尺度时空建模视频摘要生成装置,其特征在于,所述摘要根据以下步骤构建:通过对每个视频片段的优化后的重要性分数加权平均计算得到均值重要性分数 ;求解受约束的优化问题构建摘要:其中, i 为视频片段的索引值; M 为视频片段的个数; 为第 i 个视频片段中帧的数量; 为视频片段摘要指标, =1时,表明第 i 个视频片段被选中到视频摘要中, =0表明第 i 个视频片段不重要,未被选中; 为原视频的总长度。
10.多尺度时空建模视频摘要生成方法,其特征在于,包括以下步骤:搭建如权利要求1所述的多尺度时空建模模块;将输入视频划分为不重叠的片段,并利用卷积神经网络提取每个视频片段的特征;多尺度聚合器采用反卷积和池化操作获得输入特征的多尺度特征,同时在输入特征前添加片段类别标记,并应用特征融合策略聚合多尺度特征,得到融合后的特征;级联时间建模模块由多个级联的时间Mamba块构成,输入特征在多个级联的时间Mamba块中通过残差学习精炼,以融合短期提示和长期事件依赖关系,输出精炼后的特征;并行空间建模模块由多个具有共享参数的并行空间Mamba块构成,每个空间Mamba块用于处理单个帧的特征,输入特征经线性层转化为帧级特征后输入空间Mamba块,通过残差学习在空间Mamba块中并行处理,提取空间特征,并将每个空间Mamba块提取的空间特征聚合形成视频内容的特征表示;根据多尺度时空建模模块的输出特征,输出重要性分数,并结合损失函数优化重要性分数;根据优化后的重要性分数,求解约束的优化问题构建摘要。