有效

一种基于视觉信息融合的多模态摘要方法及系统

毕严先、张瑞、张兵、熊海渊、张前、鲍帆、李娜娜、李嘉辰、唐炳豪
中国电子科技集团有限公司电子科学研究院

摘要

本申请公开了一种基于视觉信息融合的多模态摘要方法及系统,涉及数据处理、人工智能技术,包括:将提取的视觉特征与文本特征拼接,并将拼接后的视觉‑文本特征输入编码器的多头注意力模块和前馈网络模块;将提取的视觉特征以及所述前馈网络模块的输出作为编码器的模态融合层的输入,以获得结合视觉信息的文本特征;将获得的结合视觉信息的文本特征、以及摘要文本特征输入解码器;将提取的视觉特征以及解码器前馈网络模块的输出作为解码器模态融合层的输入,以获得解码器输出的文本特征;将解码器输出的文本特征经过线性层,将输出的向量输入到Softmax层,依据概率分布和词汇表,获得所需的摘要文本。本申请的方法能够提高生成摘要的质量和准确性。