1.一种多尺度时序行为识别方法,其特征在于,所述方法包括:建立三维卷积特征金字塔网络模型,所述三维卷积特征金字塔网络模型包括:三维卷积特征金字塔结构、候选区域提案子网络和分类子网络;对所述三维卷积特征金字塔网络模型进行训练;所述三维卷积特征金字塔结构对输入的视频帧进行编码,并生成多级特征图;候选区域提案子网络使用所述多级特征图挑选可能包含行为片段的候选区域;分类子网络根据所述候选区域提案子网络挑选出的可能包含行为片段的候选区域,为其分配类别标签,并进一步精修候选区域的时间边界;所述分类子网络根据所述候选区域提案子网络挑选出的可能包含行为片段的候选区域,为其分配类别标签,并进一步精修候选区域的时间边界,包括:将时间长度不同的可能包含行为片段的候选区域分配到相应的金字塔级别;三维感兴趣区域池化层从相应的特征图中提取每个可能包含行为片段的候选区域的特征,得到子特征向量;在每个子特征向量内执行最大池化;将最大池化后输出特征向量经过一系列全连接层得到行为分类得分和精修后的行为片段起始时间;所述将时间长度不同的可能包含行为片段的候选区域分配到相应的金字塔级别 符合以下公式:其中, 是候选区域的时间长度, 是某个视频的时间长度, 是一个常数, 是一金字塔级别,用于调整分配给每个级别的候选区域数量。
2.根据权利要求1所述的多尺度时序行为识别方法,其特征在于,所述对所述三维卷积特征金字塔网络模型进行训练包括对候选区域提案子网络进行训练和对分类子网络进行训练;其中,对候选区域提案子网络进行训练包括:将锚段标定为正/负样本:若锚段与某些真实行为片段有重叠,且交并比高于0.7,或与某些真实行为片段有最高的交并比,则将该锚段标定为正标签,若锚段与所有的真实行为片段的交并比均低于0.3,则将该锚段标记为负样本;只采用正样本和负样本对候选区域提案子网络进行训练;对分类子网络进行训练包括:为每个候选区域分配行为类别标签:如果某候选区域与某真实行为片段具有最高交并比,同时交并比大于0.5,则给该候选区域标定为对应的行为类别标签,若某候选区域与所有真实的行为片段交并比都低于0.5,则将被标定为负标签;采用分配行为类别标签后的候选区域对分类子网络进行训练。
3.根据权利要求2所述的多尺度时序行为识别方法,其特征在于,对候选区域提案子网络进行训练时,所述正样本和所述负样本的数量比为1:1。
4.根据权利要求1所述的多尺度时序行为识别方法,其特征在于,所述三维卷积特征金字塔结构对输入的视频帧进行编码,并生成多级特征图包括:对输入的视频帧提取时空特征;使用conv1a到conv5b形成了自下而上的途径;设定在时间尺度上相同的特征图为同一个金字塔级别的特征图;通过自上而下的通道和横向连接通道构建特征金字塔结构,生成多级特征图。
5.根据权利要求4所述的多尺度时序行为识别方法,其特征在于,所述自上而下的通道由多层上采样层组成,所述横向连接层是卷积核大小为1 x 1 x 1 的三维卷积层。
6.根据权利要求1所述的多尺度时序行为识别方法,其特征在于,所述候选区域提案子网络使用所述多级特征图挑选可能包含行为片段的候选区域包括:从三维卷积特征金字塔结构生成的每个特征图中生成相应锚段;为每个锚段分配正或负标签,并对锚段进行初步的边界回归;应用非极大值抑制法挑选出可能包含行为片段的候选区域。
7.根据权利要求1所述的多尺度时序行为识别方法,其特征在于,还包括:通过同时优化分类损失和回归损失来训练候选区域提案子网络和分类子网络。
8.根据权利要求7所述的多尺度时序行为识别方法,其特征在于,所述通过同时优化分类损失和回归损失来训练候选区域提案子网络和分类子网络包括:使用交叉熵损失函数描述分类损失,使用平滑L1损失函数描述回归损失,一个子网络的联合损失函数如下:其中 和 在候选区域提案子网络中代表锚段数,而在分类子网络中代表候选区域数, 是两种损失的权衡因子, 代表锚段/候选区域索引, 是前/背景或某行为的概率预测值, 则代表真实情况, 是网络预测的锚段/候选区域与真实行为片段的偏移值,而 则是锚段/候选区域与真实行为片段的真实偏移值。