当前多模态大模型在处理复杂任务时存在能力受限、信息损失、多模态数据对齐困难等问题,尤其在政务和金融领域,需要高效处理多源异构数据、生成高质量内容并辅助决策,而现有技术难以满足这些需求。
信息传输、软件和信息技术服务业
中央引导地方专项
北京市科学技术委员会;中关村科技园区管理委员会
本课题成果来源于中央引导地方人工智能专项课题《基于多模态思维链推理的可控内容生成大模型技术研究与示范应用》,2023年9月25日立项,科技经费600万,由中译语通科技股份有限公司承担。课题实施期两年,至2025年9月24日结题。 在语料构建技术上,本课题提出多模态思维链和深度复杂指令构建技术,能够通过智能手段快速高效构建复杂应用场景的指令集,为学术界或者工业界提供大模型解决复杂能力和推理的新思路。多模态思维链技术采用反向指令策略来模拟生成数据。它可以概括为三个步骤:1)工具图构建:基于公司自研中文多模态模型和开源模型构建工具库,使用库内工具及其依赖关系构建一个工具图;2)图形采样:从工具图中抽取各种子图,以获得指定的结构;3)反向构建:基于采样工具子图,使用LLM通过反向构建指令方法生成用户指令。深度复杂指令演化技术的核心思想是通过自动化的指令生成和演化机制,逐步对模型进行复杂性训练,使其能够在多模态、多任务的环境中有效应对高难度指令。 在多模态统一架构技术上,针对单一多模态大模型能力受限问题,本课题提出MAGE架构。深入对多模态大模型在理解过程中信息损失和语义增强进行探究,提出一种弥合不同模态信息之间隔阂的语义增强网络INN,显著提升了大模型的多模态理解能力。同时,基于思维链实现了复杂指令下任意模态组合任务的认知训练,使多模态大模型能够充分理解用户请求任务的意图和复杂性,从而决定是通过自身能力还是借助外部工具,或者采用融合的手段进行应答反馈。 在多模态RAG技术上,本课题提出一种新的多模态RAG方案,将多模态数据直接在语义空间上对齐和召回,最终将多模态数据统一送入本课题产生的多模态大模型中,直接进行问答或内容生成,无需文本化的转换过程。这个创新思路,尽可能的保留多模态自身特征和语义。 在关键指标上,数据方面,构建完成了包含2亿对文本、图像、音频和视频任意组合双模态对齐、100万组四模态对齐的中文高质量数据集,提升了中文多模态语料的数据厚度,尤其是四模态对齐语料更是弥补了国内空白,能为国内中文多模态大模型的训练提供宝贵的数据资源。技术方面,形成了1套1184亿参数规模的支持四种模态统一对齐和生成的超大多模态大模型,创新技术论文成果入选CCF-A类顶会IJCAI,申请受理专利20项,为统一架构的多模态大模型行业发展提供重要学术和应用参考。应用方面,形成了一套桥接大模型和应用的多模态RAG机制,并在政务和金融上形成了有效验证的示范应用系统,覆盖问答、情感分析、报告生成等多个应用场景,为更多行业的扩展应用提供典型案例。 在政务服务应用场景中,政务领域涉及业务繁多,接入的数据多源异构,更需要有效的多模态处理、生成和决策能力来辅助政府工作人员进行高效的执行任务。通过本课题的建设,能够对数据进行提取、清洗、关联、比对、标识等处理,形成高价值的结构化业务要素。同时利用知识图谱构建、大模型问答生成能力,实现应急领域知识库的构建,为事前、事发、事中、事后四个阶段提供全方位、多角度的数据支撑能力,并实现复杂场景的理解问答、政务文档辅助写作等,为应急指挥等政务场景提供智慧化辅助支撑。 在金融领域应用场景中,依托多元业务矩阵和一级市场信息渠道全面覆盖,收集并分析市面上项目信息、机构数据、投资、并购、IPO等多模态价值数据,运用多模态大模型技术底座,以多模态智能技术进行数据抽取和结构化归类,搭建起满足各类金融场景需求的结构化数据体系,并建立产业链图谱,能够充分描绘产业链商品之间的上中下游关系、产业链各环节成员、产业链发展趋势,精准描绘产业链态势;同时,针对全国省、市、区等各级行政区划,分析各地区重点产业现状,并识别产业链发展的优劣势,为地区“强链、延链、补链”的产业链优化提供辅助决策支持。 除了,政务和金融领域外,本课题在大模型关键技术研发上,充分考虑了通用领域和专有领域的数据配比,从而使得模型在适配政务和金融领域的同时,也具有较强的其他行业应用场景的可扩展性。
