有效
基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法、装置、设备、介质及产品
段一平、陶晓明、李秀芳、汪烈军、葛宁、杨笑天
清华大学
摘要
本发明提供了一种基于层次目标‑属性‑关系模型的多模态数据语义表征与压缩方法、装置、设备、介质及产品,涉及数据处理领域。包括:边缘服务器获取多模态视频数据;对多模态视频数据分别进行像素级语义编码、视觉级语义编码、对象级语义编码和事件级语义编码,得到数据层语义信息流、视觉层语义信息流、对象层语义信息流和事件层语义信息流;再根据云端服务器的语义粒度需求,将数据层语义信息流、视觉层语义信息流、对象层语义信息流和事件层语义信息流中的一者或多者传输给云端服务器,以提高传输效率并减少语义失真。
1.基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法,其特征在于,所述方法包括:边缘服务器获取遥感卫星、无人机和地面铁塔的摄像头对目标场景同步拍摄的多模态视频数据,所述多模态视频数据包括:卫星视频数据、无人机视频数据和地面铁塔视频数据;所述边缘服务器以保留所述多模态视频数据的原始语义信息为目标,对所述多模态视频数据进行像素级语义编码,得到数据层语义信息流;所述边缘服务器以表征所述多模态视频数据中前景和背景的视觉信息为目标,对所述多模态视频数据进行视觉级语义编码,得到视觉层语义信息流;所述边缘服务器对所述多模态视频数据进行对象级语义编码,得到对象层语义信息流,对象层语义信息流用于表征所述多模态视频数据中与目标任务相关的目标-属性-关系;所述边缘服务器以表征所述多模态视频数据所包含的与所述目标任务相关的事件为目标,对所述多模态视频数据进行事件级语义编码,得到事件层语义信息流;所述边缘服务器根据云端服务器的语义粒度需求,将所述数据层语义信息流、所述视觉层语义信息流、所述对象层语义信息流和事件层语义信息流中的一者或多者传输给所述云端服务器。
2.根据权利要求1所述的基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法,其特征在于,所述方法还包括:所述云端服务器在接收到所述对象层语义信息流的情况下,通过预先训练的生成器对所述对象层语义信息流进行处理,得到重建多模态视频数据;所述预先训练的生成器是以多模态视频数据样本和对应的对象层语义信息流样本为训练数据,对生成对抗网络进行训练得到的。
3.根据权利要求2所述的基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法,其特征在于,所述方法还包括:所述云端服务器将所述对象层语义信息流样本输入所述生成对抗网络中的生成器,得到重建多模态视频数据样本;所述云端服务器将所述重建多模态视频数据样本和所述多模态视频数据样本输入所述生成对抗网络中的判别器;所述云端服务器通过所述判别器的第一分支,在局部尺度上比对所述重建多模态视频数据样本中与所述目标任务相关的对象,与,所述多模态视频数据样本中与所述目标任务相关的对象的一致性,得到第一评估结果;所述云端服务器通过所述判别器的第二分支,以所述多模态视频数据样本为基准,在全局尺度上分析所述重建多模态视频数据样本中与所述目标任务相关的对象之间的关系合理性,得到第二评估结果;所述云端服务器通过所述判别器基于所述第一评估结果和所述第二评估结果,驱动所述生成器以在语义层面逼近所述多模态视频数据样本为目标进行重建,得到所述预先训练的生成器。
4.根据权利要求2所述的基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法,其特征在于,所述方法还包括:所述云端服务器以所述多模态视频数据样本的首尾两帧为两个关键帧,获得关键帧的人工标注结果,所述人工标注结果包括首尾两帧中与所述目标任务相关的目标的包围盒;所述云端服务器将所述两个关键帧中与所述目标任务相关的目标的包围盒的中心坐标的向量的方向,确定为该目标在视频画面中的移动方向;所述云端服务器将所述两个关键帧中与所述目标任务相关的目标的包围盒的中心坐标的向量的长度,与所述两个关键帧之间的间隔时间的比值,确定为该目标在视频画面中的移动速度;所述云端服务器以所述目标任务相关的目标在视频画面中的移动速度和移动方向,为所述两个关键帧之间的多个中间帧标注与所述目标任务相关的目标的包围盒;所述云端服务器基于所述两个关键帧以及所述多个中间帧各自对应的包围盒,确定所述多模态视频数据样本中与目标任务相关的目标-属性-关系并作为所述对象层语义信息流样本。
5.根据权利要求2所述的基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法,其特征在于,所述方法还包括:所述云端服务器将所述重建多模态视频数据输入事件检测模型,得到事件检测结果;在基于所述事件检测结果确定存在目标事件的情况下,所述云端服务器向所述无人机发送调度指令,以调度所述无人机聚焦于所述目标事件进行多视角视频采集;所述云端服务器基于所述无人机采集的多视角视频数据,对所述目标事件进行持续监控。
6.根据权利要求1至5任一项所述的基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法,其特征在于,所述边缘服务器根据云端服务器的语义粒度需求,将所述数据层语义信息流、所述视觉层语义信息流、所述对象层语义信息流和事件层语义信息流中的一者或多者传输给所述云端服务器,包括:所述边缘服务器在接收到所述云端服务器发送的目标场景事件级监控需求的情况下,将所述事件层语义信息流传输给所述云端服务器;所述云端服务器在基于所述事件层语义信息流确定发生异常事件的情况下,向所述边缘服务器发送目标场景对象级监控需求;所述边缘服务器在接收到所述目标场景对象级监控需求的情况下,将所述对象层语义信息流传输给所述云端服务器;所述云端服务器在需要分析异常事件的发生原因的情况下,向所述边缘服务器发送目标场景数据级和视觉级监控需求;所述边缘服务器在接收到所述目标场景数据级和视觉级监控需求的情况下,将所述视觉层语义信息流和所述数据层语义信息流传输给所述云端服务器。
7.一种基于层次目标-属性-关系模型的多模态数据语义表征与压缩系统,其特征在于,所述系统至少包括:终端、边缘服务器和云端服务器;所述终端至少包括:遥感卫星、无人机和地面铁塔;所述终端,用于通过所述终端的摄像头对目标场景同步拍摄,获得多模态视频数据并发送给所述边缘服务器;所述边缘服务器,用于:获取所述多模态视频数据,所述多模态视频数据包括:卫星视频数据、无人机视频数据和地面铁塔视频数据;以保留所述多模态视频数据的原始语义信息为目标,对所述多模态视频数据进行像素级语义编码,得到数据层语义信息流;以表征所述多模态视频数据中前景和背景的视觉信息为目标,对所述多模态视频数据进行视觉级语义编码,得到视觉层语义信息流;对所述多模态视频数据进行对象级语义编码,得到对象层语义信息流,对象层语义信息流用于表征所述多模态视频数据中与目标任务相关的目标-属性-关系;以表征所述多模态视频数据所包含的与所述目标任务相关的事件为目标,对所述多模态视频数据进行事件级语义编码,得到事件层语义信息流;根据云端服务器的语义粒度需求,将所述数据层语义信息流、所述视觉层语义信息流、所述对象层语义信息流和事件层语义信息流中的一者或多者传输给所述云端服务器。
8.一种电子设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述计算机程序被所述处理器执行时实现如权利要求1至6任一项所述的基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法。
9.一种计算机可读存储介质,所述计算机可读存储介质上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至6任一项所述的基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法。
10.一种计算机程序产品,其特征在于,包括计算机程序,该计算机程序被处理器执行时实现如权利要求1至6任一项所述的基于层次目标-属性-关系模型的多模态数据语义表征与压缩方法。



