1.一种人眼视线落点估计方法,其特征在于,包括:获取包含人脸的图像或视频;采用MTCNN方法进行图像或视频帧中人脸检测,引入人脸关键点检测算法实现人脸关键点的检测与定位;根据人脸检测结果及人脸关键点的位置分别裁剪出人脸图像和左右眼图像;根据所述人脸检测结果生成face grid图像;使用人眼视线落点估计模型提取图像特征并进行视线估计任务,所述模型包括Base-CNNs网络和EE-Net网络,所述Base-CNNs网络对包含较少细节信息的所述人脸图像进行特征提取以获取全脸图像特征向量,所述EE-Net网络的两个不对称分支结构分别对所述左右眼图像进行更细粒度的特征提取以获得双眼图像特征向量,使用全连接层对所述全脸图像特征向量、所述双眼图像特征向量及所述face grid图像进行回归,用于最终的视线估计任务;所述EE-Net网络对所述Base-CNNs网络在模型深度、宽度及输入图像分辨率三个维度上按照规则进行缩放,缩放规则如下:在有限的计算资源内,通过调整复合缩放系数来对所述Base-CNNs网络的三个维度进行统一缩放,其计算原则如下:depth: width: resolution: (1)其中 , , 分别为提取左眼图像特征的所述EE-Net网络的左眼分支结构在深度、宽度及输入图像分辨率三个维度上的缩放系数; , , 分别为提取右眼图像特征的所述EE-Net网络的右眼分支结构在深度、宽度及输入图像分辨率三个维度上的缩放系数; 和 分别表示所述EE-Net网络在所述左眼分支结构、所述左右眼分支结构上的复合缩放系数; , , , , , , 和 的值由计算可用资源数决定; , , 和 , , 分别是所述左眼分支结构和所述左右眼分支结构的深度、宽度和分辨率缩放常数,通过贝叶斯优化的方法确定。
2.根据权利要求1所述的人眼视线落点估计方法,其特征在于,根据左右眼图像在视线估计中的表现,按照规则动态调整复合缩放系数 和 ,从而调整计算资源在双眼图像特征提取中的分配情况;在固定的计算资源限制下赋予质量相对较高的眼睛图像更大的缩放系数,使所述模型更加关注从图像质量相对较高的眼睛所提取的特征,而赋予质量相对较低的眼睛图像更小的缩放系数,使所述模型较少的关注从图像质量相对较低的眼睛所提取的特征。
3.根据权利要求2所述的人眼视线落点估计方法,其特征在于,复合缩放系数 和 的计算方法为: (2) (3)其中 为所剩计算资源常数, 和 分别为左右眼图像使用所述Base-CNNs网络进行视线估计时的L2损失值。
4.一种人眼视线落点估计系统,其特征在于,包括:图像或视频获取模块,其被配置为获取包含人脸的图像或视频;人脸检测模块,其被配置为采用MTCNN方法进行图像或视频帧中人脸检测,引入人脸关键点检测算法实现人脸关键点的检测与定位;图像裁剪模块,其被配置为根据人脸检测结果及人脸关键点的位置分别裁剪出人脸图像和左右眼图像;face grid图像生成模块,其被配置为根据所述人脸检测结果生成face grid图像;人眼视线落点估计模型,其包括Base-CNNs网络和EE-Net网络,所述Base-CNNs网络对包含较少细节信息的所述人脸图像进行特征提取以获取全脸图像特征向量,所述EE-Net网络的两个不对称分支结构分别对所述左右眼图像进行更细粒度的特征提取以获得双眼图像特征向量,然后使用全连接层对所述全脸图像特征向量、所述双眼图像特征向量及所述face grid图像进行回归,用于最终的视线估计任务;所述EE-Net网络对所述Base-CNNs网络在模型深度、宽度及输入图像分辨率三个维度上按照规则进行缩放,缩放规则如下:在有限的计算资源内,通过调整复合缩放系数来对所述Base-CNNs网络的三个维度进行统一缩放,其计算原则如下:depth: width: resolution: (1)其中 , , 分别为提取左眼图像特征的所述EE-Net网络的左眼分支结构在深度、宽度及输入图像分辨率三个维度上的缩放系数; , , 分别为提取右眼图像特征的所述EE-Net网络的右眼分支结构在深度、宽度及输入图像分辨率三个维度上的缩放系数; 和 分别表示所述EE-Net网络在所述左眼分支结构、所述左右眼分支结构上的复合缩放系数; , , , , , , 和 的值由计算可用资源数决定; , , 和 , , 分别是所述左眼分支结构和所述左右眼分支结构的深度、宽度和分辨率缩放常数,通过贝叶斯优化的方法确定。
5.根据权利要求4所述的人眼视线落点估计系统,其特征在于,根据左右眼图像在视线估计中的表现,按照规则动态调整复合缩放系数 和 ,从而调整计算资源在双眼图像特征提取中的分配情况;在固定的计算资源限制下赋予质量相对较高的眼睛图像更大的缩放系数,使所述模型更加关注从图像质量相对较高的眼睛所提取的特征,而赋予质量相对较低的眼睛图像更小的缩放系数,使所述模型较少的关注从图像质量相对较低的眼睛所提取的特征。
6.根据权利要求5所述的人眼视线落点估计系统,其特征在于,复合缩放系数 和 的计算方法为: (2) (3)其中 为所剩计算资源常数, 和 分别为左右眼图像使用所述Base-CNNs网络进行视线估计时的L2损失值。
7.一种电子设备,其特征在于,包括:摄像头,其采集包含人脸的图像或视频;处理器;存储器,包括一个或多个程序模块;其中,所述一个或多个程序模块被存储在所述存储器中并被配置为由所述处理器执行,所述一个或多个程序模块包括用于实现权利要求1-3任一项所述的人眼视线落点估计方法的指令。
8.一种存储介质,用于存储非暂时性指令,其特征在于,当所述非暂时性指令由处理器执行时能够实现权利要求1-3任一项所述的人眼视线落点估计方法。