1.一种基于外观的人眼视线方向估计方法,其特征在于,包括:获取包含人脸的图像或视频;采用MTCNN方法进行图像或视频帧中人脸检测,引入人脸关键点检测算法实现人脸关键点的检测与定位;根据人脸检测结果及人脸关键点的位置分别裁剪出人脸图像和左右眼图像;使用视线估计模型估计图像中人眼三维视线,得到人眼视线方向估计结果,所述视线估计模型的训练过程为:使用Base-CNNs网络对包含较少细节信息的所述人脸图像进行特征提取以获取全脸图像特征向量,使用EE-Net网络的两个不对称分支结构分别对所述左右眼图像进行更细粒度的特征提取以获得双眼图像特征向量,结合人脸关键点检测算法进行头部姿态向量的估算,最后使用全连接层对所述全脸图像特征向量、所述双眼图像特征向量及所述头部姿态向量进行回归,用于最终的视线估计任务;所述EE-Net网络是对所述Base-CNNs网络在模型深度、宽度及输入图像分辨率三个维度上的复合缩放,缩放规则如下:在有限的计算资源内,通过调整复合缩放系数来对所述Base-CNNs网络的三个维度进行统一缩放,其计算原则如下:depth: width: resolution: (1)其中 , , 分别为所述EE-Net网络在模型深度、宽度及输入图像分辨率三个维度上的缩放系数; 表示所述EE-Net网络的复合缩放系数,其值由可用资源数决定; , , 分别是模型的深度、宽度和分辨率缩放常数,通过贝叶斯优化的方法确定。
2.根据权利要求1所述的基于外观的人眼视线方向估计方法,其特征在于,所述头部姿态向量计算方法包括:通过人脸关键点检测算法提取人脸的68个关键点像素信息;根据其中14个点的像素坐标与标准人脸3D模型中对应的关键点坐标值的映射关系,使用 Perspective-n-Point 算法计算3D人脸坐标系到相机坐标系之间的旋转矩阵及平移矩阵,所计算的人脸坐标系到相机坐标系旋转矩阵即为所述头部姿态向量,所述头部姿态向量包括头部姿态的俯仰角、偏航角和滚转角三个维度。
3.一种基于外观的人眼视线方向估计系统,其特征在于,包括:图像或视频获取模块,其被配置为获取包含人脸的图像或视频;人脸检测模块,其被配置为采用MTCNN方法进行图像或视频帧中人脸检测,引入人脸关键点检测算法实现人脸关键点的检测与定位;图像裁剪模块,其被配置为根据人脸检测结果及人脸关键点的位置分别裁剪出人脸图像和左右眼图像;视线估计模型,其能够得到人眼视线方向估计结果,所述视线估计模型的训练过程为:使用Base-CNNs网络对包含较少细节信息的所述人脸图像进行特征提取以获取全脸图像特征向量,使用EE-Net网络的两个不对称分支结构分别对所述左右眼图像进行更细粒度的特征提取以获得双眼图像特征向量,结合人脸关键点检测算法进行头部姿态向量的估算,最后使用全连接层对所述全脸图像特征向量、所述双眼图像特征向量及所述头部姿态向量进行回归,用于最终的视线估计任务;所述EE-Net网络是对所述Base-CNNs网络在模型深度、宽度及输入图像分辨率三个维度上的复合缩放,缩放规则如下:在有限的计算资源内,通过调整复合缩放系数来对所述Base-CNNs网络的三个维度进行统一缩放,其计算原则如下:depth: width: resolution: (1)其中 , , 分别为所述EE-Net网络在模型深度、宽度及输入图像分辨率三个维度上的缩放系数; 表示所述EE-Net网络的复合缩放系数,其值由可用资源数决定; , , 分别是模型的深度、宽度和分辨率缩放常数,通过贝叶斯优化的方法确定。
4.根据权利要求3所述的基于外观的人眼视线方向估计系统,其特征在于,所述头部姿态向量计算方法包括:通过人脸关键点检测算法提取人脸的68个关键点像素信息;根据其中14个点的像素坐标与标准人脸3D模型中对应的关键点坐标值的映射关系,使用 Perspective-n-Point 算法计算3D人脸坐标系到相机坐标系之间的旋转矩阵及平移矩阵,所计算的人脸坐标系到相机坐标系旋转矩阵即为所述头部姿态向量,所述头部姿态向量包括头部姿态的俯仰角、偏航角和滚转角三个维度。
5.一种装置,其特征在于,包括:相机,其采集包含人脸的图像或视频;处理器;存储器,包括一个或多个程序模块;其中,所述一个或多个程序模块被存储在所述存储器中并被配置为由所述处理器执行,所述一个或多个程序模块包括用于实现权利要求1-2任一项所述的基于外观的人眼视线方向估计方法的指令。
6.一种存储介质,用于存储非暂时性指令,其特征在于,当所述非暂时性指令由处理器执行时能够实现权利要求1-2任一项所述的基于外观的人眼视线方向估计方法。
7.一种服务器,其特征在于,其上布置有利用权利要求1-2任一项所述的基于外观的人眼视线方向估计方法训练好的所述视线估计模型。