有效
一种基于物理模型驱动网络和液体透镜的全息相机
王琼华、王迪、李赵松、郑奕、赵悠然
北京航空航天大学
摘要
本发明提出一种基于物理模型驱动网络和液体透镜的全息相机,该全息相机由硬件部分和软件部分组成,其中硬件部分是基于液体透镜的液体相机,当改变液体透镜的上电极和下电极的电压时,液体相机能快速获取到真实3D场景的多焦面深度信息,从而快速获取真实3D场景的多焦面深度信息;软件部分是物理模型驱动网络,使用物理模型驱动网络计算和训练真实3D场景的纯相位全息图,从而快速生成真实3D场景的纯相位全息图,该纯相位全息图能够重建出具有真实深度的全息再现像。
1.一种基于物理模型驱动网络和液体透镜的全息相机,其特征在于,该全息相机由硬件部分和软件部分组成,其中硬件部分是基于液体透镜的液体相机,用于快速获取真实3D场景的多焦面深度信息,软件部分是物理模型驱动网络,用于快速计算真实3D场景的纯相位全息图,该纯相位全息图用于重建出具有真实深度的全息再现像;液体相机由相机外壳、电极线、液体透镜、固体透镜组和CMOS靶面组成,其中,液体透镜用于调节焦距,固体透镜组用于提供主光焦度,电极线连接在液体透镜的电极上,相机外壳用于固定液体透镜、固体透镜组和电极线,CMOS靶面用于接收真实3D场景的信息,液体相机的总光焦度Φ表示为:Φ=Φ s +Φ l -d sl Φ s Φ l其中,Φ s 和Φ l 分别为固体透镜组和液体透镜的光焦度,d sl 为固体透镜组的光学主平面和液体透镜的光学主平面之间的距离;在液体相机中,液体透镜由透镜外壳、两片玻璃基板、疏水层、介电层、上电极、下电极、导电液体和绝缘液体组成,上电极、下电极和两片玻璃基板间形成一个密封空间,空间中充满了绝缘液体和导电液体,两种液体之间形成自然弯曲的液-液界面,上电极的内表面依次涂有介电层和疏水层,下电极直接与导电液体相连,下电极与上电极相互绝缘,当改变液体透镜的上电极和下电极的电压时,液体相机能快速获取到真实3D场景的多焦面深度信息,且无需额外的机械运动;在全息相机中,使用物理模型驱动网络计算和训练真实3D场景的纯相位全息图的过程共分为四个步骤:第一步,利用深度计算和场景融合方法,将液体相机拍摄的真实3D场景的多焦面深度信息处理为真实3D场景的深度图和全聚焦图像,然后将真实3D场景的深度图和全聚焦图像输入编码器与解码器网络1;第二步,利用选取的物理模型,将编码器与解码器网络1生成的真实3D场景的振幅和相位信息正向传播z 0 的距离,从而得到空间光调制器上的振幅和相位信息,接着,将空间光调制器上的振幅和相位信息输入编码器与解码器网络2,从而快速生成真实3D场景的纯相位全息图;第三步,根据真实3D场景的深度图的灰度值和所选取的分层数i对深度图进行灰度区间划分,从而获得i个二值掩膜,接着,利用选取的物理模型,将真实3D场景的纯相位全息图反向传播z i 的距离,以获得i层全息再现像,然后,计算i个二值掩膜和i层全息再现像之间的点积,以获得i层带掩膜的再现像;第四步,将真实3D场景的全聚焦图像输入到非锐化掩膜滤波器中以增强高频信息,从而得到增强的3D场景,然后,将i层带掩膜的再现像进行逐像素点的相加,获得全聚焦的再现像,最后,计算增强的3D场景和全聚焦的再现像之间的损失函数,并基于损失函数优化物理模型驱动网络中的编码器与解码器网络1和编码器与解码器网络2;利用优化后的物理模型驱动网络重新计算新的真实3D场景的纯相位全息图,并重复上述步骤,直到损失函数的值小于设定的阈值,此时编码器与解码器网络2输出的真实3D场景的纯相位全息图即为最终的全息图,将最终的全息图加载到空间光调制器上,当激光照射空间光调制器时,重建出真实深度信息的真实3D场景的全息再现像。
2.根据权利要求1所述的一种基于物理模型驱动网络和液体透镜的全息相机,其特征在于,全息相机的物理模型驱动网络进行深度计算和场景融合时,对于液体相机采集到的真实3D场景的多焦面深度信息,首先利用拉普拉斯算子计算每个焦面的清晰度评估值,从而确定聚焦图像所处焦面的位置,然后,对聚焦图像进行离焦估计,并进行二值化和形态学膨胀处理,从而获得聚焦图像的掩膜信息,最后,将真实3D场景的多焦面深度信息与聚焦图像的掩膜信息进行点积计算,以获得多焦面的聚焦图像,将所有的多焦面聚焦图像进行逐像素点的相加,获得真实3D场景的全聚焦图像,同时,根据液体相机确定图像聚焦时的实际深度,通过向聚焦图像的掩膜进行灰度赋值的方法获得真实3D场景的深度图;编码器与解码器网络1包含四个下采样块、四个感知野块、四个上采样块、三个跳过连接层、一个双曲正切激活函数层和一个归一化层,编码器与解码器网络2包含四个下采样块、四个感知野块、四个上采样块、三个跳过连接层和一个双曲正切激活函数层,下采样块用于增加输入图像的通道数,并减小图像的高和宽,从而充分提取输入图像的特征信息,上采样块用于减少输入图像的通道数,并增加图像的高和宽,从而将输入图像恢复到输入时的矩阵大小,感知野块用于充分感知输入图像的特征,使网络学习到输入图像的更多信息,下采样块和上采样块之间使用了跳过连接层,从而避免梯度消失和网络退化,保证物理模型驱动网络能得到有效的训练,归一化层用于将输出图像的像素值限制在[-1,1]的范围内,双曲正切激活函数层用于将输出全息图的像素值限制在[-π,π]的范围内;输入图像每经过一个下采样块,图像的高度和宽度减半,每个下采样块包含三个序列网络、一个跳过连接层和两个1×1卷积层,图像在进入下采样块后,分别通过序列网络1、序列网络2和一个1×1卷积层后进行合并,合并的图像信息通过序列网络3和跳过连接层后,再与输入图像直接通过另一个1×1卷积层后的图像信息进行合并,最终输出;输入图像每经过一个上采样块,图像的高度和宽度增加一倍,每个上采样块包含三个序列网络、一个跳过连接层和两个2×2转置卷积层,图像在进入上采样块后,分别通过序列网络4、序列网络5和2×2转置卷积层并进行合并,合并的图像信息先通过序列网络6和跳过连接层,再与直接通过2×2转置卷积层后的图像信息进行合并,最终输出,输入图像每经过一个感知野块,图像的高度和宽度不变;每个感知野块包含四个分支网络、两个1×1卷积层和一个通道连接,图像在进入感知野块后,分别通过分支网络1、分支网络2、分支网络3和分支网络4,并通过通道连接进行合并,合并的图像信息先通过一个1×1卷积层,再与直接通过另一个1×1卷积层的图像信息进行合并,最终输出;序列网络1由一个步长为1的3×3卷积层、一个步长为2的3×3卷积层和两个参数线性整流函数层构成;序列网络2由两个步长为1的3×3卷积层、一个步长为2的3×3卷积层和三个参数线性整流函数层构成;序列网络3由两个步长为1的3×3卷积层和两个参数线性整流函数层构成;序列网络4由一个步长为1的3×3卷积层、一个步长为2的3×3卷积层、一个像素重组层、一个双三次插值层和两个参数线性整流函数层构成;序列网络5由两个步长为1的3×3转置卷积层、一个步长为2的3×3转置卷积层和两个参数线性整流函数层构成;序列网络6由两个步长为1的3×3转置卷积层和两个参数线性整流函数层构成;分支网络1由一个步长为1的1×1卷积层、一个扩张率为1且步长为1的3×3卷积层和一个参数线性整流函数层构成;分支网络2由两个步长为1的1×1卷积层、一个扩张率为3且步长为1的3×3卷积层和两个参数线性整流函数层构成;分支网络3由一个步长为1的1×1卷积层、一个步长为1的3×3卷积层、一个扩张率为3且步长为1的3×3卷积层和两个参数线性整流函数层构成;分支网络4由两个步长为1的1×1卷积层、一个步长为1的3×3卷积层、一个扩张率为5且步长为1的3×3卷积层和三个参数线性整流函数层构成,参数线性整流函数层用于解决过拟合问题,并使模型的训练更稳定。
3.根据权利要求1所述的一种基于物理模型驱动网络和液体透镜的全息相机,其特征在于,全息相机的物理模型驱动网络中的清晰度评估值C的计算方法使用拉普拉斯操作算子,清晰度评估值C的表达式为:其中,F(p,q)是对输入图像使用标准差为1的高斯滤波器过滤后的图像;l是聚焦图像的水平和垂直方向的像素数;L 3×3 是一个大小为3×3的拉普拉斯操作算子。
4.根据权利要求1所述的一种基于物理模型驱动网络和液体透镜的全息相机,其特征在于,在进行深度计算和场景融合中的离焦估计时,首先需要计算图像的边缘位置的梯度振幅比R,其表达式为:其中, 和 分别是对图像进行标准偏差为σ 1 的高斯滤波后,沿x和y方向的梯度; 和 分别是对图像进行标准偏差为σ 2 的高斯滤波后,沿x和y方向的梯度,R的大小反映物体的离焦程度,离焦估计值σ的表达式为:在对图像完成离焦估计值的计算后,获得稀疏离焦估计图d',然后,利用拉普拉斯矩阵插值法对稀疏离焦估计图d'进行插值,得到完整的离焦估计图d,其表达式为:d=λDd′(L+λD) -1其中,L为拉普拉斯矩阵,D为对角矩阵,λ为约束常数。
5.根据权利要求1所述的一种基于物理模型驱动网络和液体透镜的全息相机,其特征在于,在物理模型驱动网络中,反向传播的距离z i 的表达式为:z i =z 0 +Δd×i其中,i是选择的分层数;z 0 是基准记录距离;Δd是真实3D场景的全息再现像的深度间距;全息相机的物理模型驱动网络中的物理模型为带限角谱衍射模型,在物理模型驱动网络的训练过程中,损失函数为感知损失、多尺度结构相似性损失、总变差损失和均方误差损失的组合,损失函数Loss的表达式为:其中,ɑ,β和η分别为感知损失、多尺度结构相似性损失和总变差损失的系数,Loss PE 、Loss MS 和Loss TV 分别是感知损失、多尺度结构相似性损失和总变差损失, 表示空间光调制器上振幅信息的算术平均值,O SLM 表示空间光调制器上的振幅信息,使用由感知损失,多尺度结构相似性损失,总变差损失和均方误差损失组成的损失函数使生成的图像在视觉上更接近人眼所识别的图像,从而提高全息再现像的质量。
暂无引用专利



