1.一种基于特征表示增强的视频时刻检索方法,其特征在于,分别构建查询特征提取模块和双连接图卷积模块;该检索方法的步骤包括如下:步骤1,生成由视频、查询语句、真实时刻标签一一对应的训练集;步骤2,构建基于查询时序修正的查询特征提取模块,具体操作包括:第一步,将待查询的语句输入到训练好的SceneGraphParser网络中,输出待查询的语句中所有的主语位置单词、谓语位置单词和宾语位置单词的三元组;第二步,将待查询的语句输入到训练好的Uret网络中,输出待查询的语句中所有的谓语位置单词及谓语位置单词的按发生时间的排列顺序;第三步,以谓语位置单词的排列顺序将三元组中所有的单词串联起来,单词之间用空格分隔后组成待查询语句的增强语句,完成对待查询语句的查询时序修正操作;第四步,将增强语句中每个单词分别输入到训练好的Glove网络中,Glove网络对每个单词输出一个特征,将所有单词的特征串联获得待查询语句的特征序列;步骤3,构建基于全局候选片段特征融合的双连接图卷积模块,所述双连接图卷积模块是通过图卷积操作实现的,图节点为与待查询语句对应的视频中所有候选片段的特征,每个候选片段的特征作为一个图节点;每个图节点通过入边连接其他两个图节点,这两个图节点对应的候选片段分别为当前图节点对应候选片段的前驱全局候选片段和后继全局候选片段;在所在视频中起止时间为 的候选片段,其前驱全局候选片段为起止时间为 的片段,其后继全局候选片段为起止时间为 的片段, 为候选片段所在视频的时长;所有图节点均根据入边进行图卷积操作更新;将更新后的图节点内容作为特征表示增强的候选片段特征;步骤4,构建并训练视频时刻检索网络,该网络由查询特征提取模块、视频特征提取模块并联后,再与跨模态交互模块、双连接图卷积模块、时刻检索头模块依次级联组成;步骤5,利用训练好的视频时刻检索网络检索视频时刻。
2.根据权利要求1所述的基于特征表示增强的视频时刻检索方法,其特征在于,步骤1中所述的训练集是指,选取至少3000组样本,每组样本中均包含视频、查询语句、真实时刻标签一一对应的三项,其中视频内容中包含至少一个人物并展示任意一个动作,查询语句内容为与查询语句对应的视频中任一人物的一个动作或多个连续动作的自然语言描述,真实时刻标签内容为查询语句所描述的内容在与查询语句对应的视频中发生的起止时间。
3.根据权利要求1所述的基于特征表示增强的视频时刻检索方法,其特征在于,所述图卷积操作是通过下式得到的: ;其中, 表示第 个更新后的图节点对应的视频起止时间为 和 的特征表示增强的候选片段特征, 第 个更新前的图节点对应的视频起止时间为 和 的候选片段特征, 表示视频时长, 表示层归一化操作, 表示全连接操作。
4.根据权利要求1所述的基于特征表示增强的视频时刻检索方法,其特征在于,步骤4中所述的视频特征提取模块是,将与待查询语句对应的视频均匀分割成若干个帧数量为16的片段;将每个帧数量为16的片段分别输入到训练好的C3D网络中,输出每个片段的特征;将特征按照时间顺序排列,平均分为 组,每组特征以均值方式池化为一个特征,获得视频的特征序列。
5.根据权利要求1所述的基于特征表示增强的视频时刻检索方法,其特征在于,步骤4中所述的跨模态交互模块是,将待查询语句的特征序列和对应视频的特征序列分别通过不同的全连接层将其中的特征映射到相同维度;连接待查询语句的特征序列和对应视频的特征序列,进行位置编码;将位置编码后的待查询语句的特征序列和对应视频的特征序列输入单层跨模态Transformer,该层参数Q为视频的特征序列,K和V为待查询语句的特征序列,输出融合特征序列;对融合特征序列中任意两个特征进行连接获得所有候选片段的特征。
6.根据权利要求1所述的基于特征表示增强的视频时刻检索方法,其特征在于,步骤4中所述的时刻检索头模块是,将所有特征表示增强的候选片段特征输入到全连接层,输出每个候选片段与待查询语句的相关性分数。
7.根据权利要求1所述的基于特征表示增强的视频时刻检索方法,其特征在于,步骤4中所述视频时刻检索网络训练包含如下步骤:将训练集输入到视频时刻检索网络中,视频特征提取模块和查询特征提取模块前向传播,分别提取视频特征和待查询语句的特征;跨模态交互模块前向传播,得到候选片段特征;双连接图卷积模块前向传播,得到特征表示增强后的候选片段特征;时刻检索头模块前向传播,得到每个候选片段与待查询语句的相关性分数;使用交叉熵损失函数计算候选片段预测相关性分数与真实相关性分数之间的损失值,其中真实相关性分数来自每个候选片段在对应视频中的起始时间与对应真实时刻标签中起止时间的交并比,利用梯度下降法对随机产生的网络初始权重进行训练,迭代更新网络参数,直至网络损失函数收敛为止,得到训练好的视频时刻检索网络;所述的交叉熵损失函数如下: ;其中, 表示候选片段预测相关性分数与真实相关性分数之间的损失值, 表示训练集的样本数量, 表示每个样本在预测过程中构建的候选片段数量, 表示概率分布, 表示真实相关性分数, 表示预测相关性分数。
8.根据权利要求1所述的基于特征表示增强的视频时刻检索方法,其特征在于,步骤5中所述检索视频时刻是指,将视频和待查询语句输入到视频时刻检索网络,输出多个候选片段与查询语句的相关性分数,按照相关性分数对候选片段排序,选取相关性分数最高的候选片段作为最终检索结果。