有效
一种基于教育场景的视频语义情感识别系统
叶海燕、宋晓晓、王小超、张小伟、刘浩洋、连顺
巢湖学院
摘要
本发明公开了一种基于教育场景的视频语义情感识别系统,本发明涉及教育系统技术领域。该基于教育场景的视频语义情感识别系统,包括:数据预处理与增强模块、面部与姿势处理模块、特征提取与分类模块、双模态融合与识别模块、状态及时域分析模块、上课质量评价模块;通过全面的预处理与增强,提升视频帧质量,为后续分析奠定良好基础。面部与姿势处理模块能应对扭头、遮挡等复杂情况,保证数据完整性。双模态融合特征,结合深度神经网络时序建模,更精准识别情感。状态及时域分析模块创新性地建立含时域信息的数据库,不仅能分析学生活跃度、专心程度,还能结合时域因子剖析情感状态变化。
1.一种基于教育场景的视频语义情感识别系统,其特征在于,包括:数据预处理与增强模块:对课堂视频帧去噪、光照均衡、遮挡处理,并进行旋转操作增强数据;面部与姿势处理模块:使用MTCNN或RetinaFace算法进行课堂视频中的学生面部检测,输出学生面部的边界框,然后利用Dlib库中的68点或98点人脸关键点检测模型,进行面部关键点定位,精确捕捉包括眼睛、嘴巴、眉毛的面部特征;在检测到学生面部并定位关键点后,采用光流方程来计算面部关键点在连续视频帧之间的运动矢量;通过计算视频帧中像素点的运动矢量,持续追踪学生面部的运动轨迹;为每个关键点设置一个跟踪窗口,并设置跟踪阈值,以判断跟踪是否有效;检测头部姿势,进一步处理扭头或遮挡导致的面部不完整数据;遮挡检测:在跟踪过程中,定期检查面部边界框内的关键点可见性;设置关键点可见性阈值,当关键点数量低于阈值时,关键点被遮挡或消失时,即触发遮挡检测,通过计算关键点周围像素的梯度或颜色差异来判断关键点是否可见;当检测到遮挡时,暂停光流法跟踪,转而使用面部重检测算法在遮挡后的几帧内重新搜索面部;一旦重新检测到面部,立即恢复光流法跟踪,并更新关键点信息;扭头检测:通过分析面部关键点的角度变化,判断学生是否扭头;设置关键点角度变化阈值,若关键点的角度变化超过预设阈值,则视为扭头,使用向量夹角公式计算两个关键点向量之间的角度变化;当检测到扭头时,同样暂停光流法跟踪,并尝试通过头部姿态估计算法预测学生头部的可能位置;使用面部重检测算法在预测位置附近搜索面部;一旦重新检测到面部,恢复跟踪并更新关键点信息;特征提取与分类模块:从面部提取特征并识别和分类表情;基于检测到的人脸边界框,计算人脸的旋转角度;对人脸图像进行旋转校正,使人脸图像面向正面,在旋转校正后的人脸图像上,使用关键点检测算法来检测人脸的关键点,基于关键点计算变换矩阵应用于人脸图像的精细对齐;双模态融合与识别模块:融合学生面部表情特征和头部姿势特征,用深度神经网络进行时序建模和识别,以识别学生情感状态的变化趋势,并用于后续结合时域分子分析学生的情感状态变化情况;状态及时域分析模块:分析学生活跃度、专心程度,结合时域因子分析一天内及每堂课不同时间段学生情感状态变化率;上课质量评价模块:基于学生活跃度、专心程度、学生情感状态变化率和教师教学语音质量综合评价上课质量。
2.根据权利要求1所述的一种基于教育场景的视频语义情感识别系统,其特征在于:所述数据预处理与增强模块的操作内容具体包括:去噪处理:使用高斯滤波或中值滤波算法对课堂视频帧进行去噪,减少教室环境噪声对后续处理的影响;光照均衡处理:采用直方图均衡化或自适应直方图均衡化算法,增强课堂视频帧的对比度,使图像中的教室光照均匀;直方图均衡化原理:通过计算视频帧的直方图,重新分配像素值,以使像素值分布均匀;遮挡处理:使用图像修复算法对课堂视频中学生被遮挡的部分进行修复,恢复被遮挡的面部或身体区域;数据增强:对课堂视频帧进行旋转、缩放、裁剪、翻转操作,增加数据的多样性,以适应不同角度和距离的学生识别。
3.根据权利要求1所述的一种基于教育场景的视频语义情感识别系统,其特征在于:所述边界框表示为(x,y,w,h),其中(x,y)是检测框左上角的坐标,w和h分别是检测框的宽度和高度;关键点表示为(x i ,y i ),其中i是关键点的索引;光流法面部跟踪:设I(x,y,t)表示在时间t时,图像(x,y)位置上的像素强度;对于面部特征点P(x i ,y i ,t),在下一帧t+1时,位置变为P(x i +dx i ,y i +dy i ,t+1),其中(dx i ,dy i )是特征点P的运动矢量,且I(x i ,y i ,t)≈I(x i +dx i ,y i +dy i ,t+1);光流约束方程用于确保面部特征点在连续帧之间的亮度一致性,设u=(u i ,v i )为特征点P i 的光流矢量,其中u i 和v i 分别表示在x和y方向上的速度分量;∇I i =(Ix i ,Iy i )表示特征点P i 处图像的梯度,而İt i 表示P i 处图像强度随时间的变化率;光流约束方程∇I i ·u i +İt i =0表示,在面部特征点P i 处,图像梯度与光流矢量的点积应等于图像强度随时间的变化率的相反数;跟踪阈值包括位移阈值和速度阈值,设定位移阈值为D t ,位移 ,若d大于设定的位移阈值D t ,则判断为跟踪失败;设速度阈值为V t ,第i帧到第i+1帧的时间间隔为Δt,则关键点的速度 ,若v大于设定的速度阈值V t ,则判断为跟踪异常或可能失败。
4.根据权利要求3所述的一种基于教育场景的视频语义情感识别系统,其特征在于:关键点可见性阈值:设关键点总数为N,可见关键点数量为n^,可见性阈值设为T^,当n^<T^时,触发遮挡检测;关键点可见性判断:对于每个关键点,计算周围像素的梯度或颜色差异:梯度计算: ; ;其中I(x,y)是图像在(x,y)位置的像素值,k是Sobel算子的缩放因子;梯度模计算:梯度模是梯度向量的长度,反映图像在某点处的整体变化强度; ;阈值对比:设定一个梯度模阈值T G ,若G<T G ,则认为某关键点在当前帧中不可见即: ;颜色差异计算:diff R =│R key -R surr │;diff G =│G key -G surr │;diff B =│B key -B surr │;其中,(R key ,G key ,B key )是关键点的RGB值,(R surr ,G surr ,B surr )是周围像素的RGB值;使用欧氏距离将RGB三个通道的颜色差异综合为一个值: ;或使用加权和方式将RGB三个通道的颜色差异综合为一个值:diff 总 =α⋅diff R +β⋅diff G +γ⋅diff B ;其中,α、β、γ是权重系数,根据需要进行调整;阈值对比:设定一个颜色差异阈值T diff ,若diff 总 <T diff ,则认为关键点在当前帧中不可见,即: ;设面部关键点集合为H=(H 1 ,H 2 ,…,H m ),其中H j =(x j ,y j )表示第j个关键点的坐标,且j为1至m中任意一个自然数,为了检测扭头,选择两个关键点来形成向量,并计算这两个向量之间的角度变化;设两个关键点的向量分别为 和 ,其中(x 1 ,y 1 )和(x 2 ,y 2 )是初始帧中的关键点坐标,(x 1 ′,y 1 ′)和(x 2 ′,y 2 ′)是当前帧中的关键点坐标;定义角度变化阈值θ′,若两个向量之间的夹角θ超过阈值θ′,则视为扭头;向量v 1 和v 2 之间的夹角θ通过以下公式计算: ;其中,点积: ;向量模; ; 。
5.根据权利要求1所述的一种基于教育场景的视频语义情感识别系统,其特征在于:所述特征提取与分类模块提取面部特征的操作具体包括:S1使用多角度人脸检测器:选择一个支持多角度检测人脸的检测器,设定检测到的人脸边界框列表 B=(B 1 ,B 2 ,…,B s ),其中 B z =(x z ,y z ,w z ,h z ) 表示第z个人脸的边界框坐标,且z为1至s中任意一个自然数;S2初步对齐计算旋转角度:通过分析边界框的宽高比 和预设的正面人脸宽高比r 0 来估算旋转角度Q: ;其中,p是调整系数,用于校准旋转角度的计算;旋转图像:输入图像 I 和旋转角度Q,输出旋转后的图像 I′;S3关键点检测使用关键点检测算法:输出关键点集合 A=(A 1 ,A 2 ,…,A E ),其中A e =(x e ,y e )表示第 e 个关键点的坐标,且e为1至E中任意一个自然数;S4精细对齐计算变换矩阵:基于筛选后的关键点,使用仿射变换或相似变换来计算从检测到的关键点F到标准关键点集F 0 的变换矩阵,标准关键点集为正面人脸的关键点模板集合;应用变换:将计算出的变换矩阵应用于人脸图像,实现精细对齐;S5后处理与优化插值与平滑:对齐后,对图像进行插值或平滑处理,以消除变换过程中产生的失真或噪声;裁剪与缩放:根据对齐后的图像,裁剪出人脸区域,并根据需要进行缩放用于后续处理或分析。
6.根据权利要求1所述的一种基于教育场景的视频语义情感识别系统,其特征在于:所述特征提取与分类模块进行面部表情分类的步骤具体包括:A1.数据库构建:收集并标注大量面部表情图像,涵盖高兴、悲伤、惊讶、愤怒、恐惧、厌恶的常见表情;设 X 为原始图像数据集,其中 X f 表示第f 张图像,Y 为对应的表情标签集,Y f 表示 X f 的表情标签;使用深度学习模型对这些图像进行训练,提取深度特征;设 F(X f ) 为从 X f 提取的特征向量,维度为g;将特征与对应的表情标签一同存储于数据库中,即存储 (F(X f ),Y f ) 对;对每张图像进行人脸检测与对齐,设O为变换矩阵,X aligned 为对齐后的图像,则:X aligned =O(X);A2.实时图像采集与预处理:使用摄像头或图像输入设备实时采集学生的面部表情图像,设 X real 为实时采集的图像;对采集到的图像进行预处理步骤,包括灰度化、去噪、人脸检测与对齐,得到 X real, aligned ;A3图像对比分析:A3.1特征向量匹配:将实时图像的深度特征向量 F(X real, aligned )或原始图像与数据库中的特征向量进行比对;使用余弦相似度或欧氏距离的度量方法计算特征向量之间的相似度,选择相似度最高的几个特征向量,并查看对应的表情标签;A3.2表情分类:根据匹配到的特征向量及其表情标签,采用多数投票、加权平均或其他策略确定最终的表情类别。
7.根据权利要求1所述的一种基于教育场景的视频语义情感识别系统,其特征在于:所述双模态融合与识别模块的工作步骤具体包括:特征融合:将学生面部表情特征和头部姿势特征进行拼接或加权融合,形成综合特征;加权融合公式为: ;其中, 和ω为权重系数,J face 表示面部表情特征,J pose 表示头部姿势特征,J表示融合后的综合特征;深度识别:使用LSTM、GRU或Transformer深度神经网络对综合特征进行时序建模和深度识别,以识别学生情感状态的变化趋势;深度神经网络通过多层网络提取时序特征,输出学生情感识别结果。
8.根据权利要求1所述的一种基于教育场景的视频语义情感识别系统,其特征在于:所述状态及时域分析模块进行状态分析的步骤具体包括:数据准备:收集课堂视频中学生的面部表情和姿势数据,并划分为时间间隔为Δl的小片段;活跃度计算:定义积极情感集合E pos ={高兴,兴奋,...};对于每个时间片段l,统计积极情感出现的次数n pos (l);计算活跃度指数R: ;其中,L是总时间片段数,W pos (l)是积极情感的平均持续时间;专心程度计算:定义专注情感集合E focus ={认真,思考,...},计算专心程度指数Z: ;其中,n focus (l)为专注情感出现的次数,W focus (l)为专注情感的平均持续时间。
9.根据权利要求8所述的一种基于教育场景的视频语义情感识别系统,其特征在于:所述状态及时域分析模块结合时域因子分析情感状态变化的步骤具体包括:一天内不同时间段分析:将一天划分为M个时间段,并统计每个时间段内各情感类别出现的频率,绘制直方图;每堂课不同时间段分析:将每堂课划分为开头、中间、结尾多个阶段,并计算每个阶段内情感状态的变化率S,即下一阶段相对于上一阶段各情感类别出现频率的增长或降低率。
10.根据权利要求9所述的一种基于教育场景的视频语义情感识别系统,其特征在于:所述上课质量评价模块的工作内容具体包括:对课堂视频中教师的教学语音进行识别,并利用大语言技术识别语义,通过进行人工评价,获取评价值PJ;结合学生活跃度、专心程度、结合时域因子的情感状态变化率以及评价值多个方面的信息,使用加权平均或模糊综合评价方法对上课质量进行综合评价;综合评价公式为: ;其中, 为权重系数。



