1.一种基于文本引导优化的三维感知头像精细化表情编辑方法,其特征在于,包括以下步骤:S1:数据输入,输入一张参考人脸图像I R 和一个目标表情的文本描述;S2:初始参数提取,使用冻结的EMOCA编码器从参考图像I R 中提取FLAME模型的表情参数α R 和身份/姿态参数(θ,β),同时从StyleGAN的隐空间中随机采样一个初始隐编码w;S3:参数协同优化,将初始表情参数α R 和纹理隐编码w送入双重映射器模块,通过交叉注意力和各自的映射器网络,计算出表情参数的变化量Δα和纹理编码的变化量Δw,得到优化后的参数α R '=α R +Δα和w'=w+Δw;S4:图像合成,将优化后的参数α R '和w',连同固定的身份和姿态参数,输入到冻结的合成网络中,生成一张经过表情编辑的图像I E ;S5:多目标损失计算,将生成的图像I E 、初始图像I I (由初始参数w和α R 生成)以及目标文本送入文本引导优化模块,分别计算CLIP损失、身份损失和映射器L 2 损失;S6:模型优化,根据计算出的总损失 通过反向传播算法,只更新双重映射器模块的参数,整个过程中合成网络、EMOCA和CLIP编码器等预训练模块均保持冻结状态;S7:迭代训练,重复S3至S6步骤,对每一个表情类别分别进行训练,直到模型收敛,获得能够根据文本提示进行精确表情编辑的双重映射器。
2.根据权利要求1所述的一种基于文本引导优化的三维感知头像精细化表情编辑方法,其特征在于,所述步骤S6中总损失 为CLIP损失 身份损失 和映射器损失 三项损失的加权之和: