1.一种在场景中的人体动作捕捉方法,其特征在于,包括:获取目标对象的第一IMU数据、以及观测人员针对所述目标对象捕捉到的点云数据和图像,所述第一IMU数据由所述目标对象自身佩戴的第一IMU设备获取,所述点云数据和所述图像分别由所述观测人员佩戴的激光雷达和相机获取;根据所述第一IMU数据对所述目标对象进行动作估计,得到所述目标对象对应的人体动作;根据所述相机的外部参数将所述点云数据转化至所述相机对应的图像坐标系,以将所述点云数据与所述图像进行对齐;基于所述激光雷达自身的第二IMU数据,估计所述激光雷达的运动轨迹信息,并根据所述运动轨迹信息和对齐后的点云数据构建三维场景网格;根据人体场景接触约束项、平滑约束项、姿态先验约束项以及网格到点约束项对所述人体动作和所述三维场景网格进行优化,以得到优化后的人体动作和三维场景网格,其中,所述人体场景接触约束项用于约束人与场景接触而不穿透,所述平滑约束项用于使平移、方向和关节保持时间连续性,所述姿态先验约束项用于确保在优化开始时人体动作与IMU数据的一致性,所述网格到点约束项用于最小化人体顶点到重采样后的人体点的距离;其中,根据所述第一IMU数据对所述目标对象进行动作估计,得到所述目标对象对应的人体动作,包括:根据所述第一IMU数据进行动作估计,得到用于描述所述目标对象对应的人体动作的SMPL模型;其中,所述方法还包括:根据所述图像进行识别,确定所述图像中所述目标对象对应的骨架和边界框;基于所述点云数据以及所述SMPL模型,分别确定所述点云数据中所述目标对象对应的边界框以及所述SMPL模型中所述目标对象对应的骨架;最小化所述图像中的骨架与所述SMPL模型中的骨架之间对应点的交并损失以及所述图像中的边界框与所述点云数据中的边界框之间对应节点的均方误差之和,采用梯度下降算法以迭代优化所述相机的外部参数。
2.根据权利要求1所述的方法,其特征在于,在获取目标对象的第一IMU数据、以及观测人员针对所述目标对象捕捉到的点云数据和图像之后,所述方法还包括:分别确定所述第一IMU数据以及所述点云数据中所述目标对象在动作捕捉开始和结束时因跳跃而产生的峰值,以对所述第一IMU设备和所述激光雷达进行同步。
3.根据权利要求1所述的方法,其特征在于,所述方法还包括:去除所述SMPL模型中因被物体遮挡而无法被所述激光雷达扫描到的隐藏顶点,并模拟所述激光雷达的分辨率,基于所述激光雷达的视点对所述隐藏顶点进行重采样;将所述SMPL模型中除隐藏顶点以外的顶点视为可见人体顶点,并最小化人体点与可见人体顶点之间的距离以得到所述网格到点约束项。
4.一种在场景中的人体动作捕捉装置,其特征在于,包括:获取模块,用于获取目标对象的第一IMU数据、以及观测人员针对所述目标对象捕捉到的点云数据和图像,所述第一IMU数据由所述目标对象自身佩戴的第一IMU设备获取,所述点云数据和所述图像分别由所述观测人员佩戴的激光雷达和相机获取;第一估计模块,用于根据所述第一IMU数据对所述目标对象进行动作估计,得到所述目标对象对应的人体动作;转化模块,用于根据所述相机的外部参数将所述点云数据转化至所述相机对应的图像坐标系,以将所述点云数据与所述图像进行对齐;第二估计模块,用于基于所述激光雷达自身的第二IMU数据,估计所述激光雷达的运动轨迹信息,并根据所述运动轨迹信息和对齐后的点云数据构建三维场景网格;处理模块,用于根据人体场景接触约束项、平滑约束项、姿态先验约束项以及网格到点约束项对所述人体动作和所述三维场景网格进行优化,以得到优化后的人体动作和三维场景网格,其中,所述人体场景接触约束项用于约束人与场景接触而不穿透,所述平滑约束项用于使平移、方向和关节保持时间连续性,所述姿态先验约束项用于确保在优化开始时人体动作与IMU数据的一致性,所述网格到点约束项用于最小化人体顶点到重采样后的人体点的距离;其中,所述第一估计模块用于:根据所述第一IMU数据进行动作估计,得到用于描述所述目标对象对应的人体动作的SMPL模型;其中,所述转化模块还用于:根据所述图像进行识别,确定所述图像中所述目标对象对应的骨架和边界框;基于所述点云数据以及所述SMPL模型,分别确定所述点云数据中所述目标对象对应的边界框以及所述SMPL模型中所述目标对象对应的骨架;最小化所述图像中的骨架与所述SMPL模型中的骨架之间对应点的交并损失以及所述图像中的边界框与所述点云数据中的边界框之间对应节点的均方误差之和,采用梯度下降算法以迭代优化所述相机的外部参数。
5.一种计算机可读介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至3中任一项所述的在场景中的人体动作捕捉方法。
6.一种电子设备,其特征在于,包括:一个或多个处理器;存储装置,用于存储一个或多个程序,当所述一个或多个程序被所述一个或多个处理器执行时,使得所述一个或多个处理器实现如权利要求1至3中任一项所述的在场景中的人体动作捕捉法。