有效
一种动作识别系统、方法、装置及模型训练方法、装置
张国梁、杜泽旭、张屹、吴鹏、郑晓崑
国网智能电网研究院有限公司
摘要
本发明提供了一种动作识别系统、方法、装置及模型训练方法、装置,其中动作识别系统包括:带通滤波模块用于根据一个分段中的多帧连续图像提取动态特征图;静态特征提取模块用于根据一个分段中的多帧连续图像获取静态特征图;静态特征差异与特征位移网络用于对静态特征图进行特征位移操作,以及计算各分段对应的静态特征图之间的差异特征,得到静态分类特征;动态特征差异与特征位移网络用于对动态特征图进行特征位移操作,以及计算各分段对应的动态特征图之间的差异特征,得到动态分类特征;分类网络用于根据静态分类特征和动态分类特征得到动作识别结果。通过实施本发明能够采用更少的数据训练得到动作识别模型,并且能够实现对动作的精准识别。
1.一种动作识别系统,其特征在于,包括:信息分离网络、静态特征差异与特征位移网络、动态特征差异与特征位移网络、分类网络,所述信息分离网络包括带通滤波模块、静态特征提取模块,所述带通滤波模块用于根据一个分段中的多帧连续图像提取动态特征图,所述带通滤波模块包括空间卷积层和时间卷积层;所述静态特征提取模块用于对所述一个分段中的多帧连续图像进行时间平均池化,得到特征图,并将所述特征图与所述动态特征图作差,得到静态特征图;所述静态特征差异与特征位移网络用于对多个分段对应的静态特征图进行特征位移操作,以及计算各分段对应的静态特征图之间的差异特征,得到静态分类特征;所述动态特征差异与特征位移网络用于对多个分段对应的动态特征图进行特征位移操作,以及计算各分段对应的动态特征图之间的差异特征,得到动态分类特征;所述分类网络用于根据所述静态分类特征和所述动态分类特征得到动作识别结果。
2.根据权利要求1所述的动作识别系统,其特征在于,所述静态特征差异与特征位移网络,和/或,动态特征差异与特征位移网络包括:图像分割模块、初始特征提取模块、至少一个中间特征提取模块,所述图像分割模块用于按照第一预设大小对输入特征图进行分割,得到第一特征向量;所述初始特征提取模块包括线性嵌入子模块和至少一个特征差异与特征位移子模块,所述线性嵌入子模块用于按照预设通道数对所述第一特征向量进行转换,得到第二特征向量;所述特征差异与特征位移子模块用于对所述第二特征向量进行特征位移操作,以及计算各分段对应的第二特征向量之间的差异特征,得到初始分类特征;所述中间特征提取模块包括特征合并子模块和至少一个特征差异与特征位移子模块,所述特征合并子模块用于按照第二预设大小对所述初始分类特征进行合并,得到第三特征向量;所述特征差异与特征位移子模块用于对所述第三特征向量进行特征位移操作,以及计算各分段对应的第三特征向量之间的差异特征,得到分类特征。
3.根据权利要求2所述的动作识别系统,其特征在于,所述静态特征差异与特征位移网络,和/或,动态特征差异与特征位移网络中包括三个中间特征提取模块:第一中间特征提取模块、第二中间特征提取模块、第三中间特征提取模块,所述图像分割模块、初始特征提取模块、第一中间特征提取模块、第二中间特征提取模块、第三中间特征提取模块依次连接;所述初始特征提取模块、第一中间特征提取模块、第三中间特征提取模块中的特征差异与特征位移子模块的数量相同;所述第二中间特征提取模块中的特征差异与特征位移子模块的数量大于所述初始特征提取模块、第一中间特征提取模块、第三中间特征提取模块中的特征差异与特征位移子模块的数量。
4.根据权利要求2或3所述的动作识别系统,其特征在于,所述特征差异与特征位移子模块包括,第一归一化层、特征位移单元、特征差异单元、第二归一化层、第一全连接层、第一GELU函数层、第二全连接层,其中,第一归一化层、特征位移单元、特征差异单元、第二归一化层、第一全连接层、第一GELU函数层、第二全连接层依次连接;所述第二归一化层的输入数据为所述第一归一化层的输入数据与所述特征差异单元的输出数据的残差计算结果;所述特征差异与特征位移子模块的输出数据为所述第二归一化层的输入数据与所述第二全连接层的输出数据的残差计算结果。
5.根据权利要求4所述的动作识别系统,其特征在于,所述特征位移单元中包括第一信道全连接层、水平特征位移层、第二信道全连接层、竖直特征位移层、第三信道全连接层、第四信道全连接层,其中,所述第一信道全连接层用于对输入数据的信道进行全连接,得到全连接结果,并将所述全连接结果分别输入至所述水平特征位移层和所述竖直特征位移层中;所述水平特征位移层用于对所述全连接结果进行水平位移,得到水平位移结果,并将所述水平位移结果输入至所述第二信道全连接层中;所述竖直特征位移层用于对所述全连接结果进行竖直位移,得到竖直位移结果,并将所述竖直位移结果输入至所述第三信道全连接层中;所述第四信道全连接层用于对所述第二信道全连接层和第三信道全连接层的输出结果的和进行处理,得到所述特征位移单元的输出结果。
6.根据权利要求4所述的动作识别系统,其特征在于,所述特征差异单元包括:输入层、最大池化层、第三全连接层、第二GELU函数层、第四全连接层、上采样层、第五全连接层、第三GELU函数层、第六全连接层、特征差异输出层,其中,输入层、最大池化层、第三全连接层、第二GELU函数层、第四全连接层、上采样层、特征差异输出层依次连接;输入层、第五全连接层、第三GELU函数层、第六全连接层、特征差异输出层依次连接;所述输入层用于将当前时刻分段对应的输入特征与上一时刻分段对应的输入特征作差,并将差值特征分别输入到最大池化层和第五全连接层中;所述特征差异输出层用于将所述上采样层和所述第六全连接层的输出结果进行求和,得到求和结果;将所述求和结果与所述上一时刻分段对应的输入特征进行逐点相乘,得到相乘结果;将所述相乘结果与所述上一时刻分段对应的输入特征进行相加,得到所述特征差异单元的输出结果。
7.根据权利要求1所述的动作识别系统,其特征在于,所述分类网络包括第一时间平均池化层、第二时间平均池化层、静态特征分类器、动态特征分类器、输出层,所述第一时间平均池化层用于对多个分段对应的静态分类特征进行时间平均池化,并将池化结果输入至所述静态特征分类器中;所述第二时间平均池化层用于对多个分段对应的动态分类特征进行时间平均池化,并将池化结果输入至所述动态特征分类器中;所述静态特征分类器用于根据所述静态分类特征得到第一分类结果;所述动态特征分类器用于根据所述动态分类特征得到第二分类结果;所述识别结果输出层用于将所述第一分类结果和所述第二分类结果的加权平均结果作为输出结果。
8.一种动作识别模型训练方法,其特征在于,包括:获取多个图像序列,所述图像序列中标注有行人动作类型;将各所述图像序列分为多段子序列,得到训练数据集;将所述训练数据集输入神经网络系统,对所述神经网络系统进行训练,直到损失函数的损失值满足损失条件,得到所述动作识别模型,所述神经网络系统为权利要求1-7中任一项所述的动作识别系统。
9.根据权利要求8所述的动作识别模型训练方法,其特征在于,所述损失函数采用正交投影损失函数和交叉熵损失函数联合得到。
10.根据权利要求9所述的动作识别模型训练方法,其特征在于,所述损失函数为:L=L ce +β×L opl ,其中,L ce 表示交叉熵损失函数,L opl 表示正交投影损失函数,β表示控制正交投影损失权重的超参数。
11.一种动作识别方法,其特征在于,包括:获取目标对象的图像序列,将所述图像序列分为多段子序列;将所述子序列输入动作识别模型,生成动作识别结果,所述动作识别模型通过如权利要求8-10中任一项所述的动作识别模型训练方法训练得到。
12.根据权利要求11所述的动作识别方法,其特征在于,在将所述图像序列分为多段子序列的步骤之后,将所述子序列输入动作识别模型的步骤之前,所述方法还包括:对所述图像序列中的图像进行等比例缩放,得到缩放图像,所述缩放图像的短边大小位于预设区间内;对所述缩放图像进行随机剪裁,得到裁剪图像,所述裁剪图像的大小满足预设条件;将所述裁剪图像作为子序列中的图像,执行将所述子序列输入动作识别模型的步骤。
13.一种动作识别模型训练装置,其特征在于,包括:图像获取模块,用于获取多个图像序列,所述图像序列中标注有行人动作类型;训练数据获取模块,用于将各所述图像序列分为多段子序列,得到训练数据集;模型训练模块,用于将所述训练数据集输入神经网络系统,对所述神经网络系统进行训练,得到所述动作识别模型,所述神经网络系统为权利要求1-7中任一项所述的动作识别系统。
14.一种动作识别装置,其特征在于,包括:图像采集模块,用于获取目标对象的图像序列,将所述图像序列分为多段子序列;动作识别模块,用于将所述子序列输入动作识别模型,生成动作识别结果,所述动作识别模型通过如权利要求8-10中任一项所述的动作识别模型训练方法训练得到。
15.一种计算机设备,其特征在于,包括:至少一个处理器;以及与所述至少一个处理器通信连接的存储器;其中,所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被所述至少一个处理器执行,从而执行如权利要求1-7中任一项所述的动作识别系统,或,执行如权利要求8-10中任一项所述的动作识别模型训练方法,或,执行如权利要求11或12所述的动作识别方法。
16.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机指令,所述计算机指令用于使所述计算机执行如权利要求1-7中任一项所述的动作识别系统,或,执行如权利要求8-10中任一项所述的动作识别模型训练方法,或,执行如权利要求11或12所述的动作识别方法。



