有效
多模态事件抽取方法、装置、设备、存储介质及程序产品
曹健威、胡艳丽、曾维新、孙英杰、李凌寒、王浩源、谭真、赵翔、张鑫、蔡飞
中国人民解放军国防科技大学
曹
曹健威 专利 5
中国人民解放军国防科技大学计算模型系统模式识别知识系统
胡
胡艳丽 专利 36
中国人民解放军国防科技大学知识系统计算模型系统生物模型计算
曾
曾维新 专利 48
中国人民解放军国防科技大学知识系统数据存储检索计算模型系统
孙
孙英杰 专利 8
中国人民解放军国防科技大学计算模型系统知识系统模式识别
李
李凌寒 专利 15
合肥财经职业学院物理仪器计算技术文档装订夹持
王
王浩源 专利 4
中国人民解放军国防科技大学计算技术物理仪器计算模型系统
谭
谭真 专利 88
中国人民解放军国防科技大学自然语言处理知识系统数据存储检索
赵
赵翔 专利 194
浙江大学知识系统自然语言处理数据存储检索
张
张鑫 专利 54
中国人民解放军国防科技大学数据存储检索计算模型系统生物模型计算
蔡
蔡飞 专利 106
中国人民解放军国防科技大学自然语言处理数据存储检索知识系统
摘要
本发明公开了一种多模态事件抽取方法、装置、设备、存储介质及程序产品,该方法包括:对多模态数据中的文本数据进行特征提取,基于文本特征提取结果生成文本标签序列,对多模态数据中的图像数据进行目标检测,基于文本标签序列和目标检测结果获取多模态数据的图文细粒度信息,基于图文细粒度信息生成文本实体集合和视觉实体集合,将文本实体集合与视觉实体集合进行实体匹配,基于实体匹配结果对多模态数据进行细粒度图文对齐,并将细粒度图文对齐后的多模态数据输入至预先构建的事件抽取模型进行事件抽取,实现对全局和局部语义信息的有效分析,从而可以准确地从存在复杂语义场景的多模态数据中抽取事件,有效地避免漏掉潜在的事件价值。
1.一种多模态事件抽取方法,其特征在于,所述多模态事件抽取方法包括:对多模态数据中的文本数据进行特征提取,并基于文本特征提取结果生成文本标签序列,所述文本标签序列包含多个文本标签,所述文本标签包括所述文本数据中文本事件的文本事件类型以及各文本事件对应的文本实体;对所述多模态数据中的图像数据进行目标检测,获得目标检测结果,所述目标检测结果包括所述图像数据中的目标边界框以及各目标边界框中是否存在视觉实体的判断结果;基于所述文本标签序列和所述目标检测结果获取所述多模态数据的图文细粒度信息,并基于所述图文细粒度信息对所述多模态数据进行实体抽取,生成文本实体集合和视觉实体集合;将所述文本实体集合与所述视觉实体集合进行实体匹配,获得实体匹配结果,所述实体匹配结果包括属于同一论元角色的文本实体与视觉实体之间的匹配结果;基于所述实体匹配结果对所述多模态数据进行细粒度图文对齐,并将细粒度图文对齐后的多模态数据输入至预先构建的事件抽取模型进行事件抽取;所述对所述多模态数据中的图像数据进行目标检测,获得目标检测结果,包括:对所述多模态数据中的图像数据进行目标定位,获取所述图像数据中的实体位置信息;基于所述实体位置信息在所述图像数据中标注目标边界框;将标注后的图像数据输入至预训练目标检测模型进行目标检测,获得目标检测结果,所述预训练目标检测模型的训练损失函数包括:其中, 代表预训练目标检测模型的训练损失函数, 代表边界框损失函数,边界框损失函数用于衡量预测边界框与真实边界框之间的差异, 代表置信度损失函数,置信度损失函数用于衡量目标边界框中包含物体的置信度, 为二元分类损失函数,二元分类损失函数用于判断目标边界框中是否存在视觉实体;所述基于所述实体匹配结果对所述多模态数据进行细粒度图文对齐,并将细粒度图文对齐后的多模态数据输入至预先构建的事件抽取模型进行事件抽取之前,还包括:对所述多模态数据的文本数据和图像数据进行分析,获取所述文本数据中的抽象语义表示信息和所述图像数据中的视觉场景图;基于所述抽象语义表示信息和所述视觉场景图对文本事件和图像事件进行建模,获取初始抽取模型;根据图文对数据对所述初始抽取模型进行弱监督对齐,获得事件抽取模型。
2.如权利要求1所述的多模态事件抽取方法,其特征在于,所述文本特征提取结果包括文本序列特征信息;所述对多模态数据中的文本数据进行特征提取,并基于文本特征提取结果生成文本标签序列,包括:将多模态数据中的文本数据输入至预训练语言模型进行特征提取,获取所述文本数据的初始序列特征信息:其中, 为初始序列特征信息, 为文本序列长度, 为词向量特征的维度, 为多模态数据中的文本数据;将所述初始序列特征信息输入至预训练序列特征提取模型,获取文本序列特征信息: , 其中, 为文本序列特征信息, 为文本序列长度, 为所述预训练序列特征提取模型中隐藏层维度的大小;基于所述文本序列特征信息生成文本标签序列。
3.如权利要求2所述的多模态事件抽取方法,其特征在于,所述基于所述文本序列特征信息生成文本标签序列,包括:基于所述文本序列特征信息进行标签标注,获取多个文本标签;分析各文本标签之间的依赖关系,并基于所述依赖关系生成预测标签序列;通过得分函数计算各预测标签序列的序列得分,所述序列得分包括发射得分和转移得分,所述发射得分表示所述预测标签序列中各元素的标签得分,所述转移得分表示从一个标签转移至另一个标签的得分;基于所述序列得分对所述预测标签序列进行归一化处理,获得序列概率信息:其中, 表示预测标签序列, 表示文本序列长度, 表示所有可能的标签序列集合, 表示一条可能的标签序列, 表示得分函数, 为文本序列特征信息, 为多模态数据中的文本数据, 代表序列概率信息,所述序列概率信息包括预测标签序列 的可信概率;根据所述序列概率信息从所述预测标签序列中确定文本标签序列。
4.如权利要求1所述的多模态事件抽取方法,其特征在于,所述将所述文本实体集合与所述视觉实体集合进行实体匹配,获得实体匹配结果,包括:将所述文本实体集合与所述视觉实体集合分别输入至预训练特征编码模型进行特征编码,获得所述文本实体集合对应的文本特征表示信息以及所述视觉实体集合对应的视觉特征表示信息:其中, 为文本实体集合的文本特征表示信息, 为视觉实体集合的视觉特征表示信息, 为预训练特征编码模型中的文本编码器, 为预训练特征编码模型中的视觉编码器, 为文本实体集合, 为视觉实体集合, 为所述预训练特征编码模型中隐藏层维度的大小;基于所述文本特征表示信息和所述视觉特征表示信息计算所述文本实体集合与所述视觉实体集合中各实体之间的余弦相似度:其中, 为文本特征表示信息, 为视觉特征表示信息, 为文本实体 与视觉实体 之间的余弦相似度, 表示特征向量点积, 表示特征向量的模;根据所述余弦相似度进行实体匹配,获得实体匹配结果。
5.如权利要求1至4中任一项所述的多模态事件抽取方法,其特征在于,所述基于所述实体匹配结果对所述多模态数据进行细粒度图文对齐,并将细粒度图文对齐后的多模态数据输入至预先构建的事件抽取模型进行事件抽取之后,还包括:获取所述事件抽取模型输出的事件抽取结果,所述事件抽取结果包括所述多模态数据的预测事件类型和预测论元信息,所述预测论元信息包括论元角色、文本实体和视觉实体;基于所述预测事件类型和预测论元信息对所述事件抽取模型进行性能评估,获得性能评估结果,所述性能评估结果包括:其中,TP代表正确预测的实体数量,FP代表错误预测的实体数量,FN代表事件抽取模型未能识别到的实际实体数量, 代表模型精准率, 代表模型召回率, 代表模型精确率和模型召回率的调和平均数;根据所述性能评估结果对所述事件抽取模型进行优化。
6.一种多模态事件抽取装置,其特征在于,所述多模态事件抽取装置包括:文本事件分析模块,用于对多模态数据中的文本数据进行特征提取,并基于文本特征提取结果生成文本标签序列,所述文本标签序列包含多个文本标签,所述文本标签包括所述文本数据中文本事件的文本事件类型以及各文本事件对应的文本实体;图像事件分析模块,用于对所述多模态数据中的图像数据进行目标检测,获得目标检测结果,所述目标检测结果包括所述图像数据中的目标边界框以及各目标边界框中是否存在视觉实体的判断结果;细粒度分析模块,用于基于所述文本标签序列和所述目标检测结果获取所述多模态数据的图文细粒度信息,并基于所述图文细粒度信息对所述多模态数据进行实体抽取,生成文本实体集合和视觉实体集合;实体匹配模块,用于将所述文本实体集合与所述视觉实体集合进行实体匹配,获得实体匹配结果,所述实体匹配结果包括属于同一论元角色的文本实体与视觉实体之间的匹配结果;事件抽取模块,用于基于所述实体匹配结果对所述多模态数据进行细粒度图文对齐,并将细粒度图文对齐后的多模态数据输入至预先构建的事件抽取模型进行事件抽取;所述图像事件分析模块,还用于对所述多模态数据中的图像数据进行目标定位,获取所述图像数据中的实体位置信息;基于所述实体位置信息在所述图像数据中标注目标边界框;将标注后的图像数据输入至预训练目标检测模型进行目标检测,获得目标检测结果,所述预训练目标检测模型的训练损失函数包括:其中, 代表预训练目标检测模型的训练损失函数, 代表边界框损失函数,边界框损失函数用于衡量预测边界框与真实边界框之间的差异, 代表置信度损失函数,置信度损失函数用于衡量目标边界框中包含物体的置信度, 为二元分类损失函数,二元分类损失函数用于判断目标边界框中是否存在视觉实体;所述事件抽取模块,还用于对所述多模态数据的文本数据和图像数据进行分析,获取所述文本数据中的抽象语义表示信息和所述图像数据中的视觉场景图;基于所述抽象语义表示信息和所述视觉场景图对文本事件和图像事件进行建模,获取初始抽取模型;根据图文对数据对所述初始抽取模型进行弱监督对齐,获得事件抽取模型。
7.一种多模态事件抽取设备,其特征在于,所述多模态事件抽取设备包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的多模态事件抽取程序,所述多模态事件抽取程序配置为实现如权利要求1至5中任一项所述的多模态事件抽取方法。
8.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有多模态事件抽取程序,所述多模态事件抽取程序被处理器执行时实现如权利要求1至5任一项所述的多模态事件抽取方法。
9.一种计算机程序产品,其特征在于,所述计算机程序产品包括多模态事件抽取程序,所述多模态事件抽取程序被处理器执行时实现如权利要求1至5中任一项所述的多模态事件抽取方法的步骤。



