在审

一种基于视觉与语义特征融合的异常场景检测方法

马新强、李旺、黄琪、黄羿、陈亮、李康、杨再林、刘耀、李强、张全贵、冯勰、廖瀛、万忠杰
重庆文理学院

摘要

本申请公开了一种基于视觉与语义特征融合的异常场景检测方法,涉及安全监控和智能识别技术领域,该方法包括对采集的原始图像进行预处理,得到预处理图像;由预处理图像与预定义的结构化提示语句构成多模态输入对;将多模态输入对输入视觉语言大模型,输出包含视觉特征向量和文本向量的语义特征;将预处理图像输入目标检测模型,输出视觉特征;将语义特征与视觉特征通过跨模态注意力机制进行融合,得到多尺度融合特征;将多尺度融合特征分别输入至各尺度的检测头,执行异常场景检测,输出异常检测结果。本申请在异常场景下识别非常规物体时,融合视觉特征与语义特征进行异常场景检测,实现对复杂场景强感知能力,有效避免误报或漏报。

暂无引用专利