在审
面向长视频理解任务的视频大模型视觉令牌动态调整方法
摘要
本发明公开面向长视频理解任务的视频大模型视觉令牌动态调整方法,属于跨模态视频内容理解的长视频问答技术领域;方法包括:提取视频信息送入视频大模型,通过浅层交叉注意力得分识别关键帧,将更多的计算资源分配给关键帧,同时筛选非关键帧令牌,得到重组视觉令牌;在视频大模型中层推理中,当模型在推理过程中不确定时,动态重新引入所述重组视觉令牌;在视频大模型深层推理中,当模型的跨模态注意力已不关注重组视觉令牌时,停止对重组视觉令牌的多模态融合。本发明无需对原始模型进行再训练,通过在视频大模型推理的不同阶段采用特定的视频令牌处理方法,即可大幅提高视频大模型的推理效率,并同时提升视频大模型的内容理解和推理能力。
暂无引用专利



