1.一种基于多层级编码-解码器的视频描述方法,其特征在于,包括以下步骤:获取视频并基于多层级编码器进行编码处理,构建目标图和事件图,具体包括获取视频并对视频进行处理,得到视频帧图像并基于深度神经网络提取视频帧卷积特征;所述多层级编码器包括事件层级图卷积层、图池化层和目标层级图卷积层;基于目标层级图卷积层对视频帧卷积特征进行处理,提取目标信息并根据目标的时间关系和空间关系构建目标图;所述根据目标的时间关系和空间关系构建目标图,具体规则为判断到时间关系Sim(o i ,o j )>0.3且空间关系IOU(o i ,o j )>0.5,建立两个目标对象o i ,o j 之间的边,所述Sim(·)表示外观相似度度量,所述IOU(·)表示计算空间交互比;基于图池化层将目标层级图卷积层信息聚合并传递给事件层级图卷积层;基于事件层级图卷积层对目标图进行处理,提取事件信息并根据事件之间的时间关系构建事件图;所述根据事件之间的时间关系构建事件图,具体规则为判断到两个事件之间存在共现关系 建立事件之间的边,判断到两个事件之间存在邻近关系 建立事件之间的边,其中 表示事件i,j的结束时间, 表示事件i,j的开始时间,U i,j 代表两个事件的并集的长度,|d i,j |代表了两个事件的边界点的距离;基于多层级解码器对目标图和事件图进行解码,得到句子序列和单词序列,完成文本描述任务和句子标签预测任务。
2.根据权利要求1所述一种基于多层级编码-解码器的视频描述方法,其特征在于,还包括:构建多任务损失函数并基于损失函数更新多层级编码器和多层级解码器。
3.根据权利要求2所述一种基于多层级编码-解码器的视频描述方法,其特征在于,所述多层级解码器包括句子记忆器和描述生成器,所述损失函数包括句子级别损失和单词级别损失。
4.根据权利要求3所述一种基于多层级编码-解码器的视频描述方法,其特征在于,所述基于多层级解码器对目标图和事件图进行解码,得到句子序列和单词序列,完成文本描述任务和句子标签预测任务这一步骤,其具体包括:基于句子记忆器对事件图进行解码处理,结合前一句子的信息解码得到所有事件的句子,按顺序生成句子序列;基于描述生成器按顺序对目标图进行解码处理,结合句子序列和前一单词的信息完成所有目标图的解码,生成单词序列;基于多任务学习完成文本描述任务和句子标签预测任务。
5.一种基于多层级编码-解码器的视频描述系统,其特征在于,包括以下模块:编码模块,用于获取视频并基于多层级编码器进行编码处理,构建目标图和事件图,具体包括获取视频并对视频进行处理,得到视频帧图像并基于深度神经网络提取视频帧卷积特征;所述多层级编码器包括事件层级图卷积层、图池化层和目标层级图卷积层;基于目标层级图卷积层对视频帧卷积特征进行处理,提取目标信息并根据目标的时间关系和空间关系构建目标图;所述根据目标的时间关系和空间关系构建目标图,具体规则为判断到时间关系Sim(o i ,o j )>0.3且空间关系IOU(o i ,o j )>0.5,建立两个目标对象o i ,o j 之间的边,所述Sim(·)表示外观相似度度量,所述IOU(·)表示计算空间交互比;基于图池化层将目标层级图卷积层信息聚合并传递给事件层级图卷积层;基于事件层级图卷积层对目标图进行处理,提取事件信息并根据事件之间的时间关系构建事件图;所述根据事件之间的时间关系构建事件图,具体规则为判断到两个事件之间存在共现关系 建立事件之间的边,判断到两个事件之间存在邻近关系 建立事件之间的边,其中 表示事件i,j的结束时间, 表示事件i,j的开始时间,U i,j 代表两个事件的并集的长度,|d i,j |代表了两个事件的边界点的距离;解码模块,用于基于多层级解码器对目标图和事件图进行解码,得到句子序列和单词序列。