在审
多模态文档解析方法、装置、电子设备及存储介质
摘要
本申请涉及多模态文档解析技术领域,揭示了一种多模态文档解析方法、装置、电子设备及存储介质,其中,方法包括:通过第三方库模块自动识别并提取文档中的图片元素,结合图片位置生成占位符,再利用多模态大模型进行语义理解与文本生成,使视觉内容转化为可结构化的信息文本。本发明的有益效果:通过引入多模态大语言模型,实现了对文本、图片、表格、流程图等多模态信息的统一解析,不仅保留了文档的版面语义与逻辑结构,还实现了图文内容的融合解析,显著提升了文档解析的完整性与智能化水平,与传统单模态方法相比,本发明能对多模态内容的统一理解与结构化表达,输出更丰富、更精确的结构化结果。
暂无引用专利



